技术团队成员(语言模型评估)
关于 Artificial Analysis
Artificial Analysis 是领先的独立 AI 基准测试公司。我们帮助实验室、工程师和企业理解 AI 能力,并就其 AI 战略做出关键决策。从 AI 实验室和企业,到媒体、投资者与政策制定者,我们都是了解 AI 的首选权威。我们的基准测试不仅衡量 AI 的前沿,还在积极塑造这一前沿。
我们的基准测试与分析受到数十万用户信赖,是 OpenAI、Google、Meta、NVIDIA 和 Anthropic 等领先 AI 实验室,以及《华尔街日报》、Bloomberg、《金融时报》和《经济学人》等主要媒体的首选参考。
我们是一支 40 多人的团队,有望在年底前将规模扩大至三倍,支持者包括 Nat Friedman(Github、Meta)、Daniel Gross(SSI)、Andrew Ng(Google Brain、DeepLearning.ai、Amazon)、Adam D'Angelo(Quora、Poe、OpenAI)、Clem Delangue(Hugging Face)及其他行业领袖。
职位机会
语言模型评估是 AI 领域最尖锐的问题:这些系统实际上能做什么?从 Artificial Analysis Intelligence Index 到 AA-Omniscience、AA-Briefcase 以及我们的编程智能体评估,我们的答案是行业所依赖的参考标准。我们正在招聘技术团队成员,构建下一代评估。
这个职位适合希望构建前沿基准测试的人:设计始终领先于前沿能力的评估,构建能够抵抗污染的数据集,并衡量其他人尚未弄清如何衡量的内容。你将在每个重要模型发布时运行你的工作,并发布整个行业都会阅读的结果。
这个职位的核心是构建。分析与实验室协作围绕评估工作展开,日常客户关系由我们的商务团队负责。
你将负责
- 设计下一代前沿评估:构思并交付下一代前沿评估,如 AA-Briefcase 和 AA-Omniscience,覆盖推理、知识、编程、智能体能力及其他维度
- 构建评估数据集与基础设施:构建支撑我们基准测试的数据集、harness 和评分系统,以抗污染性和前沿规模下的可重复性为目标进行工程设计
- 塑造未来的 Intelligence Index:你构建的评估将贡献于 Artificial Analysis Intelligence Index 的未来版本以及我们平台的其他领域,定义行业如何衡量前沿能力
- 发布有影响力的分析:产出塑造行业对语言模型进展认知的报告、指数和数据可视化
- 与前沿实验室合作评估预发布模型:对领先实验室的系统进行基准测试,包括预发布和新发布的模型,直接与其研究团队合作;日常客户关系由商务团队负责,因此你的时间可专注于科学本身
- 评估每一个重要模型:在前沿模型发布时运行我们的评估套件,并负责行业引用结果的完整性
- 采用 AI 原生工作方式:拥抱 AI 原生工作流,利用前沿 AI 工具在快速变化的行业中提高效能,并保持我们在 AI 基准测试领域的竞争优势
我们期待你
你拥有评估语言模型的深厚实践经验,并对大多数基准测试为何失败有鲜明见解。
相关背景包括:AI 实验室的评估与基准测试团队;专注评估的组织中的研究或工程职位;在生产环境中构建过评估 harness 和数据集的机器学习工程师;或在 NLP 与机器学习评估领域有扎实发表记录的学术研究者。
要求:
- 3 年以上相关专业经验,可来自产业或研究
- 出色的分析与批判性思维能力
- 扎实的 Python 能力,具备运行评估 harness 和构建数据集的实践经验
- 深入熟悉 LLM 评估格局:主要基准测试及其失效模式、污染、基于偏好的方法,以及智能体评估
- 扎实的统计学基础:能够判断结果何时是信号、何时是噪声
- 对前沿 AI 具有真实、可证明的兴趣和了解。我们需要的是对 AI 发展方向有充分依据的见解,而不仅仅是会使用 AI 工具的人
为什么选择 Artificial Analysis?
- 影响 AI 的构建方式:领先的 AI 实验室会追踪我们的基准测试,并以此指导开发重点。你的工作将直接影响 AI 的发展方向。
- 成为世界级 AI 专家:每当重要模型发布时,你都会从各项主要能力维度对其进行评估。很少有职位能让你如此广泛地接触前沿 AI。
- 与 AI 领域最重要的参与者合作:你将作为值得信赖的独立声音,与领先 AI 实验室和大型企业的团队建立并管理合作关系。
- 在关键时刻加入:我们有 40 多人,正按计划在年底前将规模扩大一倍,并获得了 AI 领域人脉最广泛的一批投资者支持。现在加入的人将在公司规模扩张的过程中塑造产品、团队和战略。
- 具有竞争力的薪酬,包括股权