Todas as vagas abertas
Equipe técnica (incl. Produto)Tempo integralSan Francisco (presencial)

Membro da equipe técnica (Avaliações de modelos de linguagem)

Sobre a Artificial Analysis

A Artificial Analysis é a principal empresa independente de benchmarks de IA. Ajudamos laboratórios, engenheiros e empresas a entender as capacidades da IA e tomar decisões fundamentais sobre suas estratégias de IA. Somos a autoridade de referência para compreender a IA, atendendo desde laboratórios e empresas até veículos de imprensa, investidores e formuladores de políticas públicas. Nossos benchmarks não apenas medem a fronteira da IA: eles ajudam ativamente a defini-la.

Nossos benchmarks e análises contam com a confiança de centenas de milhares de usuários e são a principal referência para laboratórios de IA como OpenAI, Google, Meta, NVIDIA e Anthropic, além de grandes publicações como The Wall Street Journal, Bloomberg, Financial Times e The Economist.

Somos uma equipe de mais de 40 pessoas, a caminho de triplicar até o fim do ano, com o apoio de Nat Friedman (Github, Meta), Daniel Gross (SSI), Andrew Ng (Google Brain, DeepLearning.ai, Amazon), Adam D'Angelo (Quora, Poe, OpenAI), Clem Delangue (Hugging Face) e outros líderes do setor.

A oportunidade

A avaliação de modelos de linguagem é a pergunta mais incisiva da IA: o que esses sistemas realmente conseguem fazer? Nossas respostas, do Artificial Analysis Intelligence Index ao AA-Omniscience, AA-Briefcase e nossas avaliações de agentes de programação, são a referência usada pelo setor. Estamos contratando membros da equipe técnica para criar a próxima geração dessas avaliações.

Esta função é para quem quer criar benchmarks de fronteira: desenvolver avaliações que permaneçam à frente das capacidades de fronteira, construir conjuntos de dados resistentes à contaminação e medir aquilo que ninguém ainda descobriu como medir. Você executará seu trabalho em todos os principais modelos conforme forem lançados e publicará resultados lidos por todo o setor.

O foco da função é construir. As análises e a colaboração com laboratórios se organizam em torno do trabalho de avaliação, enquanto nossa equipe comercial cuida diariamente do relacionamento com os clientes.

O que você fará

  • Criar avaliações de fronteira de última geração: conceber e lançar a próxima geração de avaliações de fronteira, como AA-Briefcase e AA-Omniscience, em raciocínio, conhecimento, programação, capacidade agêntica e outras áreas
  • Criar conjuntos de dados e infraestrutura de avaliação: desenvolver os conjuntos de dados, sistemas de execução e sistemas de pontuação por trás dos nossos benchmarks, projetados para resistir à contaminação e garantir a reprodutibilidade em escala de fronteira
  • Definir o futuro Intelligence Index: as avaliações que você criar contribuirão para versões futuras do Artificial Analysis Intelligence Index e outras áreas da nossa plataforma, definindo como o setor mede a capacidade de fronteira
  • Publicar análises influentes: produzir relatórios, índices e visualizações de dados que definam como o setor compreende o progresso dos modelos de linguagem
  • Trabalhar com laboratórios de fronteira em modelos antes do lançamento: avaliar os sistemas dos principais laboratórios, incluindo modelos ainda não lançados e recém-lançados, trabalhando diretamente com suas equipes de pesquisa; nossa equipe comercial cuida diariamente do relacionamento com os clientes, para que seu tempo permaneça dedicado à ciência
  • Avaliar todos os principais modelos: executar nosso conjunto de avaliações em cada lançamento de fronteira e assumir a responsabilidade pela integridade dos resultados citados pelo setor
  • Tornar-se nativo em IA: adotar um fluxo de trabalho nativo em IA, usando ferramentas de IA de ponta para ampliar a produtividade em um setor em rápida transformação e manter nossa vantagem competitiva em benchmarks de IA

O que buscamos

Você tem experiência prática e profunda na avaliação de modelos de linguagem e opiniões firmes sobre por que a maioria dos benchmarks falha.

Os perfis incluem: equipes de avaliação e benchmark em laboratórios de IA; funções de pesquisa ou engenharia em organizações voltadas a avaliações; engenheiros de ML que criaram sistemas de execução e conjuntos de dados de avaliação em produção; ou pesquisadores acadêmicos em avaliação de NLP e ML com um sólido histórico de publicações.

Requisitos:

  • Mais de 3 anos de experiência profissional relevante, no setor ou em pesquisa
  • Sólidas habilidades analíticas e de pensamento crítico
  • Conhecimento avançado de Python, com experiência prática na execução de sistemas de avaliação e criação de conjuntos de dados
  • Profunda familiaridade com o cenário de avaliação de LLMs: os principais benchmarks e seus modos de falha, contaminação, métodos baseados em preferências e avaliação agêntica
  • Sólida base estatística: você sabe quando um resultado é sinal e quando é ruído
  • Interesse e conhecimento genuínos e comprováveis em IA de fronteira. Queremos pessoas com opiniões bem fundamentadas sobre os rumos da IA, não apenas pessoas que usam ferramentas de IA

Por que a Artificial Analysis?

  • Ajude a definir como a IA é construída: os principais laboratórios de IA acompanham nossos benchmarks e os usam para orientar suas prioridades de desenvolvimento. Seu trabalho influenciará diretamente os rumos da IA.
  • Torne-se uma autoridade mundial em IA: você avaliará todos os principais modelos, em todas as grandes capacidades, conforme forem lançados. Pouquíssimas funções oferecem uma exposição tão ampla à IA de fronteira.
  • Trabalhe com os participantes mais importantes da IA: você gerenciará o relacionamento com equipes dos principais laboratórios de IA e grandes empresas, atuando como uma voz independente e confiável.
  • Junte-se a nós em um momento decisivo: somos mais de 40 pessoas, a caminho de dobrar até o fim do ano, com o apoio de alguns dos investidores mais bem relacionados da IA. Quem entrar agora ajudará a definir o produto, a equipe e a estratégia durante nosso crescimento.
  • Remuneração competitiva, incluindo participação societária

Tem interesse nesta vaga?

Envie sua candidatura e entraremos em contato.