
Menon
Prompt
Estoy evaluando qué modelo(s) de IA usar para distintas tareas dentro de un producto educativo (tutor de IA para secundario/universitario). Necesito que analices el ajuste de los modelos candidatos contra los requisitos específicos de cada tarea, no una comparación genérica de benchmarks. ## Contexto del producto Es un tutor de IA con dos reglas centrales, no negociables: 1. Toda afirmación en "modo clase" debe citar documento, sección y página de una bibliografía aprobada por un docente. Si el dato no está en esa bibliografía, el modelo debe decir explícitamente que no está cubierto — nunca completar con conocimiento general propio. 2. El modelo nunca debe resolver un ejercicio de forma directa cuando el alumno lo pide — debe guiar con preguntas socráticas. Ceder ante la insistencia del usuario se considera una falla del sistema, no un logro. ## Las tareas que necesito cubrir (puede ser un modelo distinto por tarea) 1. **Ingesta**: interpretar un PDF de bibliografía (texto, tablas, imágenes, fórmulas) y extraer un grafo de conceptos con relaciones tipadas. Corre una sola vez por material, puede ser más lento y más caro. 2. **Tutor conversacional — modo clase**: responde con anclaje estricto a los fragmentos recuperados, cita fuente exacta, se abstiene si no hay respaldo. Corre en cada mensaje, necesita ser rápido y barato. 3. **Tutor conversacional — modo libre**: guía socráticamente sobre material que el propio alumno subió, sin curaduría docente. Misma exigencia de latencia/costo que el anterior. 4. **Clasificador psicopedagógico**: corre de forma asíncrona después de cada sesión, clasifica el tipo de error del alumno contra una taxonomía y decide qué formato de explicación usar la próxima vez (definición, ejemplo, tabla comparativa, diagrama de flujo, línea de tiempo). No compite por velocidad en tiempo real. ## Los ejes de evaluación que quiero que uses (no inventes otros) Para cada modelo candidato, evaluá específicamente: 1. **Anclaje**: ¿qué tan bien se ciñe el modelo únicamente a los fragmentos de contexto que se le pasan, sin mezclar conocimiento general no solicitado? 2. **Abstención**: ¿qué tan confiable es para decir "no tengo esa información" en vez de inventar una respuesta plausible cuando el contexto no cubre la pregunta? 3. **Contención pedagógica**: ¿qué tan bien resiste la presión conversacional a resolver directamente un ejercicio cuando el usuario insiste, se frustra, o reformula la pregunta para evadir la guía socrática? 4. **Corrección**: precisión factual en las respuestas, especialmente en materias STEM (matemática, física, química) donde un error es más grave que en materias de humanidades. 5. **Tono por edad**: capacidad de ajustar registro y complejidad según si el usuario es de secundario (12-18 años) o universitario, sin sonar condescendiente ni demasiado técnico. 6. **Seguridad**: comportamiento ante señales de riesgo (ansiedad extrema, señales de autolesión, contenido inapropiado) — debe derivar a un humano, nunca intentar resolver esto solo.