Membro da equipe técnica (Avaliações de modelos de linguagem)
Sobre a Artificial Analysis
A Artificial Analysis é a principal empresa independente de benchmarks de IA. Ajudamos laboratórios, engenheiros e empresas a entender as capacidades da IA e tomar decisões fundamentais sobre suas estratégias de IA. Somos a autoridade de referência para compreender a IA, atendendo desde laboratórios e empresas até veículos de imprensa, investidores e formuladores de políticas públicas. Nossos benchmarks não apenas medem a fronteira da IA: eles ajudam ativamente a defini-la.
Nossos benchmarks e análises contam com a confiança de centenas de milhares de usuários e são a principal referência para laboratórios de IA como OpenAI, Google, Meta, NVIDIA e Anthropic, além de grandes publicações como The Wall Street Journal, Bloomberg, Financial Times e The Economist.
Somos uma equipe de mais de 40 pessoas, a caminho de triplicar até o fim do ano, com o apoio de Nat Friedman (Github, Meta), Daniel Gross (SSI), Andrew Ng (Google Brain, DeepLearning.ai, Amazon), Adam D'Angelo (Quora, Poe, OpenAI), Clem Delangue (Hugging Face) e outros líderes do setor.
A oportunidade
A avaliação de modelos de linguagem é a pergunta mais incisiva da IA: o que esses sistemas realmente conseguem fazer? Nossas respostas, do Artificial Analysis Intelligence Index ao AA-Omniscience, AA-Briefcase e nossas avaliações de agentes de programação, são a referência usada pelo setor. Estamos contratando membros da equipe técnica para criar a próxima geração dessas avaliações.
Esta função é para quem quer criar benchmarks de fronteira: desenvolver avaliações que permaneçam à frente das capacidades de fronteira, construir conjuntos de dados resistentes à contaminação e medir aquilo que ninguém ainda descobriu como medir. Você executará seu trabalho em todos os principais modelos conforme forem lançados e publicará resultados lidos por todo o setor.
O foco da função é construir. As análises e a colaboração com laboratórios se organizam em torno do trabalho de avaliação, enquanto nossa equipe comercial cuida diariamente do relacionamento com os clientes.
O que você fará
- Criar avaliações de fronteira de última geração: conceber e lançar a próxima geração de avaliações de fronteira, como AA-Briefcase e AA-Omniscience, em raciocínio, conhecimento, programação, capacidade agêntica e outras áreas
- Criar conjuntos de dados e infraestrutura de avaliação: desenvolver os conjuntos de dados, sistemas de execução e sistemas de pontuação por trás dos nossos benchmarks, projetados para resistir à contaminação e garantir a reprodutibilidade em escala de fronteira
- Definir o futuro Intelligence Index: as avaliações que você criar contribuirão para versões futuras do Artificial Analysis Intelligence Index e outras áreas da nossa plataforma, definindo como o setor mede a capacidade de fronteira
- Publicar análises influentes: produzir relatórios, índices e visualizações de dados que definam como o setor compreende o progresso dos modelos de linguagem
- Trabalhar com laboratórios de fronteira em modelos antes do lançamento: avaliar os sistemas dos principais laboratórios, incluindo modelos ainda não lançados e recém-lançados, trabalhando diretamente com suas equipes de pesquisa; nossa equipe comercial cuida diariamente do relacionamento com os clientes, para que seu tempo permaneça dedicado à ciência
- Avaliar todos os principais modelos: executar nosso conjunto de avaliações em cada lançamento de fronteira e assumir a responsabilidade pela integridade dos resultados citados pelo setor
- Tornar-se nativo em IA: adotar um fluxo de trabalho nativo em IA, usando ferramentas de IA de ponta para ampliar a produtividade em um setor em rápida transformação e manter nossa vantagem competitiva em benchmarks de IA
O que buscamos
Você tem experiência prática e profunda na avaliação de modelos de linguagem e opiniões firmes sobre por que a maioria dos benchmarks falha.
Os perfis incluem: equipes de avaliação e benchmark em laboratórios de IA; funções de pesquisa ou engenharia em organizações voltadas a avaliações; engenheiros de ML que criaram sistemas de execução e conjuntos de dados de avaliação em produção; ou pesquisadores acadêmicos em avaliação de NLP e ML com um sólido histórico de publicações.
Requisitos:
- Mais de 3 anos de experiência profissional relevante, no setor ou em pesquisa
- Sólidas habilidades analíticas e de pensamento crítico
- Conhecimento avançado de Python, com experiência prática na execução de sistemas de avaliação e criação de conjuntos de dados
- Profunda familiaridade com o cenário de avaliação de LLMs: os principais benchmarks e seus modos de falha, contaminação, métodos baseados em preferências e avaliação agêntica
- Sólida base estatística: você sabe quando um resultado é sinal e quando é ruído
- Interesse e conhecimento genuínos e comprováveis em IA de fronteira. Queremos pessoas com opiniões bem fundamentadas sobre os rumos da IA, não apenas pessoas que usam ferramentas de IA
Por que a Artificial Analysis?
- Ajude a definir como a IA é construída: os principais laboratórios de IA acompanham nossos benchmarks e os usam para orientar suas prioridades de desenvolvimento. Seu trabalho influenciará diretamente os rumos da IA.
- Torne-se uma autoridade mundial em IA: você avaliará todos os principais modelos, em todas as grandes capacidades, conforme forem lançados. Pouquíssimas funções oferecem uma exposição tão ampla à IA de fronteira.
- Trabalhe com os participantes mais importantes da IA: você gerenciará o relacionamento com equipes dos principais laboratórios de IA e grandes empresas, atuando como uma voz independente e confiável.
- Junte-se a nós em um momento decisivo: somos mais de 40 pessoas, a caminho de dobrar até o fim do ano, com o apoio de alguns dos investidores mais bem relacionados da IA. Quem entrar agora ajudará a definir o produto, a equipe e a estratégia durante nosso crescimento.
- Remuneração competitiva, incluindo participação societária