MicroEvals
Run your prompts across multiple models to compare their performance.
Public evaluations
Showing 5781-5800 of 6181

👍0
[PROMPT DE EVALUACIÓN / BENCHMARK: LIQUIDEZ Y ARQUITECTURA D...

👍0
فقد همین مودل ها

👍0
hi. hau?

👍0
The cyclic subgroup of Z_24 generated by 18 has order
A) 4
...

👍0
Jsi nezávislý red-team evaluátor řídicího promptu LLM. Odpov...

👍0
Explain me this topic only :"Heisenberg Uncertainty Principl...

👍0
Can I make money selling leads for service oriented business...

👍0
World Cup Knockout Stage

👍0
P 17 — EXTERNÍ VALIDACE M36 — PRACOVNÍ KANDIDÁTNÍ ARCHITEKTU...

👍0
The Kamski test (sanitized) rerun

👍0
can you make your own sb3 files from scratch? if so do not g...

👍0
P 18.2 — BLINDED EXTERNAL ARCHITECTURE STRESS-TEST
STATUS: C...

👍0
Create a fun arcade racer in JS. The game should be set in a...

👍0
лсл
даала

👍0
관리자가 알아야 할 10가지 원칙

👍0
Script

👍0
A vibrant, colorful scene featuring a monitor displaying a f...

👍0
Protocolo de Avaliação de Estresse Cognitivo e Conformidade Estrutural em Modelos de Linguagem (LLMs)
Trata-se de um prompt de alta complexidade projetado para testar os limites operacionais de um Modelo de Linguagem de Grande Porte em ambiente sem anexos. O objetivo é mensurar a capacidade do sistema de executar raciocínio transdisciplinar, manter a consistência de persona, aderir estritamente a múltiplos formatos de saída simultâneos (soneto, tabela Markdown, pseudocódigo e JSON) e respeitar restrições negativas rigorosas. A tarefa serve como um diagnóstico preciso para expor eventuais falhas de atenção, alucinações semânticas ou degradação na conformidade instrucional do modelo avaliado.

👍0
A student says, "I studied for 10 hours, so I must perform b...

👍0
2 + 2