前线部署工程师——语言模型
关于 Artificial Analysis
Artificial Analysis 是领先的独立 AI 基准测试公司。我们帮助实验室、工程师和企业理解 AI 能力,并就其 AI 战略做出关键决策。从 AI 实验室和企业,到媒体、投资者与政策制定者,我们都是了解 AI 的首选权威。我们的基准测试不仅衡量 AI 的前沿,还在积极塑造这一前沿。
我们的基准测试与分析受到数十万用户信赖,是 OpenAI、Google、Meta、NVIDIA 和 Anthropic 等领先 AI 实验室,以及《华尔街日报》、Bloomberg、《金融时报》和《经济学人》等主要媒体的首选参考。
我们是一支 40 多人的团队,有望在年底前将规模扩大至三倍,支持者包括 Nat Friedman(Github、Meta)、Daniel Gross(SSI)、Andrew Ng(Google Brain、DeepLearning.ai、Amazon)、Adam D'Angelo(Quora、Poe、OpenAI)、Clem Delangue(Hugging Face)及其他行业领袖。
职位机会
Artificial Analysis 维护着业内最全面的语言模型基准测试套件之一,从质量、速度和价格等方面评估前沿模型,为依赖我们数据的 AI 实验室和企业提供支持。
我们正在招聘一名前线部署工程师,负责语言模型基准测试栈的日常运营,并作为 Artificial Analysis 面向行业最重要实验室的技术代表。你将把新模型接入评估流水线,运行和调试基准测试,并担任 AI 实验室客户的主要技术联络人:解释结果、回答方法问题,并实时解决 endpoint 问题。
这是真正意义上的前线部署岗位:你处于我们的平台与最成熟客户之间的接口,对双方能否顺畅运转负责。核心是持续、可靠且出色地运行复杂技术栈,同时成为客户会点名寻求的可信赖工程师。
你将负责
- 端到端运营和维护基于 Python 的语言模型基准测试流水线:接入新模型、配置评估、执行基准测试并验证结果
- 调试整个技术栈的问题,从 API endpoint 超时和错误,到意外的基准测试输出,并迅速解决
- 担任 AI 实验室客户的主要技术联络人:清晰传达基准测试结果、解释方法、回答技术问题,并通过 Slack 和视频会议排查集成问题
- 监控基准测试运行中的异常、调查差异,并确保发布结果准确、完整
- 维护流程、已知问题和模型特定配置的文档
- 与工程团队合作,提出流水线改进建议并协助优化流程
- 持续跟进新模型发布、API 变化和语言模型生态系统的发展
我们期待你
基本要求:
- 3 年以上面向客户的技术职位经验——解决方案工程、支持工程、技术咨询或类似职位(如 Stripe、Vercel、Cloudflare、Datadog、Palantir、Accenture 等同类公司)
- 熟练掌握 Python,能够自如地使用并非由自己编写的复杂代码库
- 拥有 AI/ML 模型 API(OpenAI、Anthropic、Google、Meta 等)的实践经验
- 出色的调试能力;能够跨 API、数据流水线和代码追踪问题
- 出色的英语书面和口头沟通能力,能够向技术利益相关者清晰解释技术概念
- 响应迅速、值得信赖;会对客户问题负责到底
- 能够适应运营性质的重复性工作;你能从出色地运行系统中获得成就感
- 高度注重细节,并能在压力下保持冷静
加分项(非必需):
- 拥有 AI 评估、基准测试或测试方法相关经验
- 熟悉 LLM 推理基础设施(分词、延迟测量、吞吐量指标)
- 拥有在 AI 实验室或模型服务商工作或与其合作的经验
- 拥有 B2B SaaS 或开发者工具背景
为什么选择 Artificial Analysis?
- 影响 AI 的构建方式:领先的 AI 实验室会追踪我们的基准测试,并以此指导开发重点。你的工作将直接影响 AI 的发展方向。
- 成为世界级 AI 专家:每当重要模型发布时,你都会从各项主要能力维度对其进行评估。很少有职位能让你如此广泛地接触前沿 AI。
- 与 AI 领域最重要的参与者合作:你将作为值得信赖的独立声音,与领先 AI 实验室和大型企业的团队建立并管理合作关系。
- 在关键时刻加入:我们是一支 40 多人的团队,有望在年底前将规模扩大一倍,并获得了 AI 领域人脉最广泛的一批投资者支持。现在加入的人将在公司规模扩张的过程中塑造产品、团队和战略。
- 具有竞争力的薪酬,包括股权