LongCat - 基座agent评测分析算法研究员(生产力方向)
面议
负责围绕AI大模型算法的认知分析的研究工作,具体工作内容包括但不限于:
1. 深入理解大规模语言模型的模型结构、训练过程以及评测方式,根据模型的训练过程以及评测结果,对大语言模型存在的问题进行研究。
2. 深度参与通用生产力在claude code/OpenClaw等场景下的基座模型能力优化迭代,设计具有长路径、多步骤交互特征的评测任务集,实现从“单次问答”到“闭环任务”的评测转型。
3. 探索长周期下Agent在复杂任务的能力边界,涵盖工具调用、决策规划和记忆管理等方向,对前沿评测范式如基于沙盒环境的动态评测和多agent协同效率等进行深入...