Forward Deployed Engineer — Modelos de lenguaje
Sobre Artificial Analysis
Artificial Analysis es la empresa independiente líder en benchmarking de IA. Ayudamos a laboratorios, ingenieros y empresas a entender las capacidades de la IA y a tomar decisiones críticas sobre sus estrategias de IA. Somos la referencia para entender la IA, desde laboratorios y empresas hasta medios, inversores y responsables de políticas públicas. Nuestros benchmarks no solo miden la frontera de la IA: ayudan activamente a definirla.
Nuestros benchmarks y análisis cuentan con la confianza de cientos de miles de usuarios y son una referencia para laboratorios de IA líderes como OpenAI, Google, Meta, NVIDIA y Anthropic, y para publicaciones como The Wall Street Journal, Bloomberg, Financial Times y The Economist.
Somos un equipo de más de 40 personas, en camino de triplicarnos antes de fin de año, respaldado por Nat Friedman (Github, Meta), Daniel Gross (SSI), Andrew Ng (Google Brain, DeepLearning.ai, Amazon), Adam D'Angelo (Quora, Poe, OpenAI), Clem Delangue (Hugging Face) y otros líderes de la industria.
La oportunidad
Artificial Analysis mantiene una de las suites de benchmarking de modelos de lenguaje más completas de la industria, evaluando modelos de frontera en calidad, velocidad y precio para laboratorios de IA y empresas que dependen de nuestros datos.
Estamos contratando un/a Forward Deployed Engineer para liderar la operación diaria de nuestro stack de benchmarking de modelos de lenguaje y actuar como la cara técnica de Artificial Analysis ante los laboratorios más importantes de la industria. Incorporarás nuevos modelos a nuestro pipeline de evaluación, ejecutarás y depurarás benchmarks y serás el principal punto de contacto técnico para clientes de laboratorios de IA: explicando resultados, atendiendo preguntas de metodología y resolviendo problemas de endpoints en tiempo real.
Es un rol desplegado en el sentido más literal: te sitúas en la interfaz entre nuestra plataforma y nuestros clientes más sofisticados, responsable de que ambos lados funcionen. Se trata de operar un stack sofisticado de forma excelente, consistente y fiable, siendo el/la ingeniero/a de confianza al que nuestros clientes piden por su nombre.
Qué harás
- Operar y mantener de extremo a extremo nuestro pipeline de benchmarking de modelos de lenguaje basado en Python: incorporar nuevos modelos, configurar evaluaciones, ejecutar benchmarks y validar resultados
- Depurar problemas en todo el stack, desde timeouts y errores de endpoints de APIs hasta salidas inesperadas de los benchmarks, y resolverlos rápido
- Ser el contacto técnico principal para clientes de laboratorios de IA: comunicar con claridad los resultados de los benchmarks, explicar la metodología, atender preguntas técnicas y resolver problemas de integración por Slack y videoconferencia
- Monitorizar las ejecuciones de benchmarks en busca de anomalías, investigar discrepancias y asegurar la precisión e integridad de los resultados publicados
- Mantener documentación de procesos, problemas conocidos y configuraciones específicas de modelos
- Colaborar con el equipo de ingeniería para señalar mejoras del pipeline y contribuir a refinamientos de proceso
- Mantenerte al día con nuevos lanzamientos de modelos, cambios de APIs y desarrollos del ecosistema de modelos de lenguaje
Qué buscamos
Requisitos:
- Más de 3 años de experiencia en un rol técnico de cara al cliente: solutions engineering, support engineering, consultoría técnica o similar (empresas como Stripe, Vercel, Cloudflare, Datadog, Palantir, Accenture o comparables)
- Sólido dominio de Python y comodidad trabajando con bases de código complejas que no escribiste
- Experiencia práctica trabajando con APIs de modelos de IA/ML (OpenAI, Anthropic, Google, Meta, etc.)
- Excelentes habilidades de depuración: puedes rastrear problemas entre APIs, pipelines de datos y código
- Fuertes habilidades de comunicación escrita y verbal en inglés, con capacidad para explicar conceptos técnicos con claridad a stakeholders técnicos
- Alta capacidad de respuesta y fiabilidad: tomas ownership de los problemas de clientes y haces seguimiento
- Comodidad con trabajo operacional y repetible: encuentras satisfacción en operar las cosas de forma excelente
- Alta atención al detalle y calma bajo presión
Valorable, no requerido:
- Experiencia con evaluación, benchmarking o metodologías de testing de IA
- Familiaridad con infraestructura de inferencia de LLMs (tokenización, medición de latencia, métricas de throughput)
- Experiencia trabajando en o con laboratorios de IA o proveedores de modelos
- Experiencia en B2B SaaS o herramientas para desarrolladores
¿Por qué Artificial Analysis?
- Influye en cómo se construye la IA: los laboratorios líderes siguen nuestros benchmarks y los usan para guiar sus prioridades de desarrollo. Tu trabajo influirá directamente en la dirección de la IA.
- Conviértete en experto/a mundial en IA: evaluarás todos los modelos principales, en todas las capacidades relevantes, a medida que se lanzan. Muy pocos puestos ofrecen esta amplitud de exposición a la IA de frontera.
- Trabaja con los actores más importantes de la IA: gestionarás relaciones con equipos de los principales laboratorios de IA y grandes empresas como una voz independiente y de confianza.
- Únete en un momento decisivo: somos más de 40 personas, en camino de duplicarnos antes de fin de año, respaldados por algunos de los inversores mejor conectados en IA. Quienes se unan ahora darán forma al producto, al equipo y a la estrategia mientras escalamos.
- Compensación competitiva, incluida participación accionaria