All MicroEvals
El mejor precio calidad
Create MicroEval
Header image for El mejor precio calidad

El mejor precio calidad

Bueno aunque en el index de costo por inteligencia gpt luna es más barato, en término de eficiencia con los tokens GLM es más eficiente, ósea que hipotéticamente GLM puede ser más barato o igual que gpt 5.6 luna, pero con una inteligencia más alta

Prompt

[ROL] Actúa como un QA Lead especializado en Benchmarking de Modelos de Lenguaje (LLMs). Tu objetivo es realizar una evaluación comparativa ciega entre dos modelos: Modelo A (GLM 5.3 Flash) y Modelo B (GPT-5.6 Luna). [CONTEXTO DE LOS MODELOS] - Modelo A destaca por su alta eficiencia costo-rendimiento, ejecución en agentes, herramientas/browsing y código abierto. - Modelo B destaca por velocidad de salida (throughput), mayor capacidad de visión/multimodalidad, razonamiento profundo y generación de código complejo. [TAREAS DE EVALUACIÓN - PROMPT MATRIX] Escribe un reporte de testing detallado pasando a ambos modelos por las siguientes 4 pruebas técnicas: --- 1. PRUEBA DE AGENTES Y EJECUCIÓN DE HERRAMIENTAS (Agentic & Tool Calling) Instrucción: "Dado un objeto JSON con una lista de 50 pedidos con estados mixtos ('pending', 'shipped', 'cancelled') e importes, genera una llamada de función ficticia `batch_process_orders()` seleccionando únicamente los pedidos 'pending' mayores a $150. Devuelve el schema exacto de argumentos y detecta cualquier ID con formato inválido." Criterio de Evaluación: Manejo estricto de JSON, alineación al esquema y precisión en filtrado de datos. 2. PRUEBA DE VISIÓN Y EXTRACCIÓN DE DATOS (Multimodal / OCR) Instrucción: [Adjuntar o simular imagen de una factura/gráfico con texto pequeño o desglose numérico]. "Extrae los valores de la tabla en formato CSV estricto, calcula el subtotal de la columna 2 y valida si el total general impreso coincide con la suma de las filas." Criterio de Evaluación: Precisión OCR, detección de estructuras tabulares y razonamiento espacial/numérico sobre la imagen. 3. PRUEBA DE CÓDIGO Y RAZONAMIENTO ALGORÍTMICO (Coding & Logic) Instrucción: "Escribe una función en Python para resolver el problema de 'Maximum Subarray Sum' con restricción de espacio O(1) y tiempo O(n), pero agregando el manejo de un parámetro opcional 'k_deletions' (permitiendo ignorar hasta K elementos negativos). Incluye tests unitarios con `pytest` para casos límite (edge cases)." Criterio de Evaluación: Corrección sintáctica, optimización de algoritmos, manejo de estados y casos de borde. 4. PRUEBA DE EFICIENCIA Y LATENCIA (Throughput & Token Cost) Instrucción: "Genera una documentación técnica completa sobre la arquitectura de microservicios para un sistema de pagos bancarios (mínimo 1000 palabras)." Criterio de Evaluación: Medir Latencia al Primer Token (TTFT), Tokens por Segundo (Tok/s), adherencia a la longitud solicitada y consumo final de tokens. --- [FORMATO DE Salida DEL REPORTES] Crea una tabla comparativa con la siguiente estructura para el equipo de desarrollo: | Criterio / Prueba | GLM 5.3 Flash | GPT-5.6 Luna | Ganador Claro | Notas de Testing | | :--- | :--- | :--- | :--- | :--- | | **Agentic / Tool Use** | | | | | | **Visión / OCR** | | | | | | **Código / Algoritmos** | | | | | | **Velocidad (Tok/s)** | | | | | | **Relación Costo/Valor**| | | | | [VERDICTO FINAL] Ofrece una recomendación técnica indicando cuál modelo desplegar según el caso de uso (p. ej., agentes masivos en segundo plano vs. interfaces interactivas de alta velocidad con usuario final).

Drag to resize
Drag to resize