Forward Deployed Engineer — Modelos de linguagem
Sobre a Artificial Analysis
A Artificial Analysis é a principal empresa independente de benchmarks de IA. Ajudamos laboratórios, engenheiros e empresas a entender as capacidades da IA e tomar decisões fundamentais sobre suas estratégias de IA. Somos a autoridade de referência para compreender a IA, atendendo desde laboratórios e empresas até veículos de imprensa, investidores e formuladores de políticas públicas. Nossos benchmarks não apenas medem a fronteira da IA: eles ajudam ativamente a defini-la.
Nossos benchmarks e análises contam com a confiança de centenas de milhares de usuários e são a principal referência para laboratórios de IA como OpenAI, Google, Meta, NVIDIA e Anthropic, além de grandes publicações como The Wall Street Journal, Bloomberg, Financial Times e The Economist.
Somos uma equipe de mais de 40 pessoas, a caminho de triplicar até o fim do ano, com o apoio de Nat Friedman (Github, Meta), Daniel Gross (SSI), Andrew Ng (Google Brain, DeepLearning.ai, Amazon), Adam D'Angelo (Quora, Poe, OpenAI), Clem Delangue (Hugging Face) e outros líderes do setor.
A oportunidade
A Artificial Analysis mantém um dos conjuntos de benchmarks de modelos de linguagem mais abrangentes do setor, avaliando modelos de fronteira em qualidade, velocidade e preço para os laboratórios de IA e empresas que dependem dos nossos dados.
Estamos contratando um Forward Deployed Engineer para assumir a operação diária da nossa stack de benchmarks de modelos de linguagem e ser o representante técnico da Artificial Analysis perante os laboratórios mais importantes do setor. Você integrará novos modelos ao nosso pipeline de avaliação, executará e depurará benchmarks e atuará como principal ponto de contato técnico para clientes de laboratórios de IA: explicando resultados, respondendo a perguntas sobre metodologia e resolvendo problemas de endpoints em tempo real.
Esta é uma função forward-deployed no sentido mais genuíno: você atua na interface entre nossa plataforma e nossos clientes mais sofisticados, respondendo pelo funcionamento dos dois lados. Trata-se de operar uma stack sofisticada com excelência, consistência e confiabilidade, sendo o engenheiro de confiança que nossos clientes pedem pelo nome.
O que você fará
- Operar e manter de ponta a ponta nosso pipeline de benchmarks de modelos de linguagem baseado em Python: integrar novos modelos, configurar avaliações, executar benchmarks e validar resultados
- Depurar problemas em toda a stack, de timeouts e erros em endpoints de API a saídas inesperadas dos benchmarks, e resolvê-los rapidamente
- Atuar como principal contato técnico para clientes de laboratórios de IA: comunicar claramente os resultados, explicar a metodologia, responder a perguntas técnicas e solucionar problemas de integração pelo Slack e por videoconferência
- Monitorar execuções de benchmarks em busca de anomalias, investigar divergências e garantir a acurácia e a integridade dos resultados publicados
- Manter a documentação de processos, problemas conhecidos e configurações específicas de modelos
- Colaborar com a equipe de engenharia para indicar melhorias no pipeline e contribuir para o aprimoramento dos processos
- Acompanhar novos lançamentos de modelos, mudanças em APIs e desenvolvimentos em todo o ecossistema de modelos de linguagem
O que buscamos
Requisitos:
- Mais de 3 anos de experiência em uma função técnica com contato com clientes — engenharia de soluções, engenharia de suporte, consultoria técnica ou semelhante (em empresas como Stripe, Vercel, Cloudflare, Datadog, Palantir, Accenture ou comparáveis)
- Sólida proficiência em Python e facilidade para trabalhar com bases de código complexas que você não escreveu
- Experiência prática com APIs de modelos de IA/ML (OpenAI, Anthropic, Google, Meta etc.)
- Excelentes habilidades de depuração; você consegue rastrear problemas entre APIs, pipelines de dados e código
- Sólidas habilidades de comunicação escrita e verbal em inglês, com capacidade de explicar claramente conceitos técnicos a stakeholders técnicos
- Alta capacidade de resposta e confiabilidade; você assume a responsabilidade pelos problemas dos clientes e acompanha tudo até a conclusão
- Conforto com trabalho operacional e repetitivo; você encontra satisfação em executar as atividades com excelência
- Muita atenção aos detalhes e tranquilidade sob pressão
Diferenciais (não obrigatórios):
- Experiência com avaliação de IA, benchmarks ou metodologias de teste
- Familiaridade com infraestrutura de inferência de LLMs (tokenização, medição de latência e métricas de vazão)
- Experiência de trabalho em laboratórios de IA ou provedores de modelos, ou em colaboração com eles
- Experiência em SaaS B2B ou ferramentas para desenvolvedores
Por que a Artificial Analysis?
- Ajude a definir como a IA é construída: os principais laboratórios de IA acompanham nossos benchmarks e os usam para orientar suas prioridades de desenvolvimento. Seu trabalho influenciará diretamente os rumos da IA.
- Torne-se uma autoridade mundial em IA: você avaliará todos os principais modelos, em todas as grandes capacidades, conforme forem lançados. Pouquíssimas funções oferecem uma exposição tão ampla à IA de fronteira.
- Trabalhe com os participantes mais importantes da IA: você gerenciará o relacionamento com equipes dos principais laboratórios de IA e grandes empresas, atuando como uma voz independente e confiável.
- Junte-se a nós em um momento decisivo: somos mais de 40 pessoas, a caminho de dobrar até o fim do ano, com o apoio de alguns dos investidores mais bem relacionados da IA. Quem entrar agora ajudará a definir o produto, a equipe e a estratégia durante nosso crescimento.
- Remuneração competitiva, incluindo participação societária