기술 스태프(언어 모델 평가)
Artificial Analysis 소개
Artificial Analysis는 선도적인 독립 AI 벤치마킹 기업입니다. 연구소, 엔지니어, 기업이 AI 역량을 이해하고 AI 전략에 관한 중요한 결정을 내릴 수 있도록 지원합니다. AI 연구소와 기업부터 미디어, 투자자, 정책 입안자에 이르기까지 AI를 이해하는 데 가장 먼저 찾는 권위 있는 기관입니다. 당사의 벤치마크는 최첨단 AI를 측정하는 데 그치지 않고 프런티어를 적극적으로 형성합니다.
수십만 명의 사용자가 당사의 벤치마크와 분석을 신뢰합니다. OpenAI, Google, Meta, NVIDIA, Anthropic을 비롯한 주요 AI 연구소와 The Wall Street Journal, Bloomberg, Financial Times, The Economist를 비롯한 주요 언론이 이를 핵심 참고 자료로 활용합니다.
40명 이상의 팀으로 올해 말까지 세 배로 성장할 계획이며, Nat Friedman(Github, Meta), Daniel Gross(SSI), Andrew Ng(Google Brain, DeepLearning.ai, Amazon), Adam D'Angelo(Quora, Poe, OpenAI), Clem Delangue(Hugging Face)를 비롯한 업계 리더들의 후원을 받고 있습니다.
기회
언어 모델 평가에서 가장 중요한 질문은 '이 시스템이 실제로 무엇을 할 수 있는가'입니다. Artificial Analysis Intelligence Index부터 AA-Omniscience, AA-Briefcase, 코딩 에이전트 평가에 이르기까지 당사의 답변은 업계의 기준으로 활용됩니다. 차세대 평가를 구축할 기술 스태프를 채용합니다.
프런티어 벤치마크를 만들고 싶은 사람을 위한 직무입니다. 프런티어 역량보다 앞서 나가는 평가를 설계하고, 오염에 강한 데이터 세트를 구축하며, 아직 누구도 측정 방법을 찾지 못한 것을 측정합니다. 주요 모델이 출시될 때마다 직접 만든 평가를 실행하고 업계 전체가 읽는 결과를 발표합니다.
직무의 중심은 구축입니다. 분석과 연구소 협업은 평가 업무를 중심으로 이루어지며, 고객 관계의 일상적인 관리는 상업 팀이 담당합니다.
담당 업무
- 차세대 프런티어 평가 설계: AA-Briefcase와 AA-Omniscience처럼 추론, 지식, 코딩, 에이전트형 역량 및 그 이상의 분야를 아우르는 차세대 프런티어 평가를 구상하고 출시합니다.
- 평가 데이터 세트 및 인프라 구축: 프런티어 규모에서 오염에 강하고 반복 가능한 벤치마크 데이터 세트, 하니스, 채점 시스템을 구축합니다.
- 미래의 Intelligence Index 설계: 직접 만든 평가가 향후 Artificial Analysis Intelligence Index 버전과 플랫폼의 다른 영역에 반영되어 업계의 프런티어 역량 측정 방식을 정의합니다.
- 영향력 있는 분석 발표: 업계의 언어 모델 발전 이해에 영향을 주는 보고서, 지수, 데이터 시각화를 제작합니다.
- 출시 전 모델을 두고 프런티어 연구소와 협력: 출시 전 및 신규 출시 모델을 포함한 주요 연구소의 시스템을 벤치마킹하고 연구팀과 직접 협력합니다. 고객 관계의 일상적인 관리는 상업 팀이 담당하므로 과학에 집중할 수 있습니다.
- 모든 주요 모델 평가: 프런티어 모델이 출시되는 즉시 평가 스위트를 실행하고 업계가 인용하는 결과의 무결성을 책임집니다.
- AI 네이티브로 성장: 최첨단 AI 도구를 활용하는 AI 네이티브 워크플로를 받아들여 빠르게 변하는 업계에서 업무 효율을 높이고 AI 벤치마킹의 경쟁 우위를 유지합니다.
자격 요건
언어 모델을 직접 평가한 깊이 있는 경험과 대부분의 벤치마크가 실패하는 이유에 관한 뚜렷한 견해가 있어야 합니다.
AI 연구소의 평가 및 벤치마킹 팀, 평가 전문 조직의 연구 또는 엔지니어링 직무, 프로덕션 환경에서 평가 하니스와 데이터 세트를 구축한 ML 엔지니어, 탄탄한 논문 실적을 보유한 NLP 및 ML 평가 분야의 학계 연구자 경력을 포함합니다.
필수 요건:
- 산업 또는 연구 분야의 관련 경력 3년 이상
- 뛰어난 분석력과 비판적 사고 능력
- 뛰어난 Python 역량과 평가 하니스 실행 및 데이터 세트 구축 실무 경험
- 주요 벤치마크와 실패 유형, 오염, 선호도 기반 방법, 에이전트형 평가를 포함한 LLM 평가 생태계에 대한 깊은 이해
- 결과가 유의미한 신호인지 잡음인지 판단할 수 있는 탄탄한 통계적 기반
- 프런티어 AI에 대한 진정성 있고 입증 가능한 관심과 지식. 단순히 AI 도구를 사용하는 사람이 아니라 AI의 향방에 관해 근거 있는 견해를 가진 사람
왜 Artificial Analysis인가요?
- AI가 만들어지는 방식에 영향을 미치세요: 주요 AI 연구소는 당사의 벤치마크를 추적하고 개발 우선순위를 정하는 데 활용합니다. 여러분의 업무가 AI의 방향에 직접 영향을 미칩니다.
- 세계적인 AI 전문가로 성장하세요: 주요 모델이 출시될 때마다 모든 핵심 역량에 걸쳐 평가합니다. 프런티어 AI를 이처럼 폭넓게 접할 수 있는 직무는 매우 드뭅니다.
- AI 업계에서 가장 중요한 주역들과 협력하세요: 신뢰받는 독립적인 목소리로서 주요 AI 연구소 및 대기업 팀과의 관계를 관리합니다.
- 결정적인 순간에 합류하세요: 40명 이상의 팀으로 올해 말까지 두 배로 성장할 계획이며, AI 업계에서 인맥이 가장 폭넓은 투자자들의 후원을 받고 있습니다. 지금 합류하는 구성원은 회사가 성장하는 과정에서 제품, 팀, 전략을 만들어 갑니다.
- 지분을 포함한 경쟁력 있는 보상