Miembro del equipo técnico (evaluaciones de modelos de lenguaje)
Sobre Artificial Analysis
Artificial Analysis es la empresa independiente líder en benchmarking de IA. Ayudamos a laboratorios, ingenieros y empresas a entender las capacidades de la IA y a tomar decisiones críticas sobre sus estrategias de IA. Somos la referencia para entender la IA, desde laboratorios y empresas hasta medios, inversores y responsables de políticas públicas. Nuestros benchmarks no solo miden la frontera de la IA: ayudan activamente a definirla.
Nuestros benchmarks y análisis cuentan con la confianza de cientos de miles de usuarios y son una referencia para laboratorios de IA líderes como OpenAI, Google, Meta, NVIDIA y Anthropic, y para publicaciones como The Wall Street Journal, Bloomberg, Financial Times y The Economist.
Somos un equipo de más de 40 personas, en camino de triplicarnos antes de fin de año, respaldado por Nat Friedman (Github, Meta), Daniel Gross (SSI), Andrew Ng (Google Brain, DeepLearning.ai, Amazon), Adam D'Angelo (Quora, Poe, OpenAI), Clem Delangue (Hugging Face) y otros líderes de la industria.
La oportunidad
La evaluación de modelos de lenguaje es la pregunta más afilada de la IA: ¿qué pueden hacer realmente estos sistemas? Nuestras respuestas, desde el Artificial Analysis Intelligence Index hasta AA-Omniscience, AA-Briefcase y nuestras evaluaciones de agentes de programación, son la referencia que usa la industria. Estamos contratando miembros del equipo técnico para construir la próxima generación.
Es un puesto para quienes quieren construir benchmarks de frontera: diseñar evaluaciones que se adelanten a las capacidades de frontera, construir datasets que resistan la contaminación y medir lo que nadie más ha averiguado aún cómo medir. Ejecutarás tu trabajo sobre todos los modelos principales a medida que se lanzan y publicarás resultados que lee toda la industria.
El centro del puesto es construir. El análisis y la colaboración con laboratorios se articulan alrededor del trabajo de evaluación, y nuestro equipo comercial lleva el día a día de las relaciones con clientes.
Qué harás
- Diseñar evaluaciones de frontera de nueva generación: concebir y lanzar la próxima generación de evaluaciones de frontera, como AA-Briefcase y AA-Omniscience, en razonamiento, conocimiento, programación, capacidad agentic y más allá
- Construir datasets e infraestructura de evaluación: construir los datasets, harnesses y sistemas de puntuación que hay detrás de nuestros benchmarks, diseñados para resistir la contaminación y ser reproducibles a escala de frontera
- Dar forma al futuro Intelligence Index: las evaluaciones que construyas contribuirán a futuras versiones del Artificial Analysis Intelligence Index y a otras áreas de nuestra plataforma, definiendo cómo la industria mide la capacidad de frontera
- Publicar análisis influyentes: producir los informes, índices y visualizaciones de datos que dan forma a cómo la industria entiende el progreso de los modelos de lenguaje
- Trabajar con laboratorios de frontera en modelos pre-lanzamiento: evaluar los sistemas de los laboratorios líderes, incluidos modelos pre-lanzamiento y recién lanzados, trabajando directamente con sus equipos de investigación; nuestro equipo comercial lleva el día a día de las relaciones con clientes, así que tu tiempo se queda en la ciencia
- Evaluar todos los modelos principales: ejecutar nuestra suite de evaluación sobre los lanzamientos de frontera a medida que llegan y asumir la integridad de los resultados que la industria cita
- Adoptar un flujo de trabajo AI-native: usar herramientas de IA de vanguardia para generar apalancamiento en una industria que cambia rápido y mantener nuestra ventaja competitiva en benchmarking de IA
Qué buscamos
Tienes experiencia profunda y práctica evaluando modelos de lenguaje y opiniones firmes sobre por qué fallan la mayoría de los benchmarks.
Perfiles habituales: equipos de evaluación y benchmarking en laboratorios de IA; roles de investigación o ingeniería en organizaciones centradas en evaluación; ML engineers que han construido harnesses y datasets de evaluación en producción; o investigadores académicos en evaluación de NLP y ML con un sólido historial de publicaciones.
Requisitos:
- Más de 3 años de experiencia profesional relevante, en industria o investigación
- Sólidas habilidades analíticas y de pensamiento crítico
- Python sólido, con experiencia práctica ejecutando harnesses de evaluación y construyendo datasets
- Familiaridad profunda con el panorama de evaluación de LLMs: los principales benchmarks y sus modos de fallo, la contaminación, los métodos basados en preferencia y la evaluación agentic
- Base estadística sólida: sabes cuándo un resultado es señal y cuándo es ruido
- Interés y conocimiento genuinos y demostrables de la IA de frontera; buscamos personas con opiniones informadas sobre hacia dónde va la IA, no solo personas que usan herramientas de IA
¿Por qué Artificial Analysis?
- Influye en cómo se construye la IA: los laboratorios líderes siguen nuestros benchmarks y los usan para guiar sus prioridades de desarrollo. Tu trabajo influirá directamente en la dirección de la IA.
- Conviértete en experto/a mundial en IA: evaluarás todos los modelos principales, en todas las capacidades relevantes, a medida que se lanzan. Muy pocos puestos ofrecen esta amplitud de exposición a la IA de frontera.
- Trabaja con los actores más importantes de la IA: gestionarás relaciones con equipos de los principales laboratorios de IA y grandes empresas como una voz independiente y de confianza.
- Únete en un momento decisivo: somos más de 40 personas, en camino de duplicarnos antes de fin de año, respaldados por algunos de los inversores mejor conectados en IA. Quienes se unan ahora darán forma al producto, al equipo y a la estrategia mientras escalamos.
- Compensación competitiva, incluida participación accionaria