MicroEvals
Run your prompts across multiple models to compare their performance.
Public evaluations
Showing 6421-6440 of 6871

👍0
Explain me this topic only :"Heisenberg Uncertainty Principl...

👍0
Can I make money selling leads for service oriented business...

👍0
World Cup Knockout Stage

👍0
P 17 — EXTERNÍ VALIDACE M36 — PRACOVNÍ KANDIDÁTNÍ ARCHITEKTU...

👍0
The Kamski test (sanitized) rerun

👍0
You are an elite game-engine engineer, graphics engineer, ph...

👍0
项目设计
一个我们公司真实的项目设计需求

👍0
import { getExaApiKey } from "@/lib/env";
import { asSummary...

👍0
Complete the following Python function:
```python
from typi...

👍0
can you make your own sb3 files from scratch? if so do not g...

👍0
Trading_Astra

👍0
Create a pro level complex mobile friendly professional 3D m...

👍0
P 18.2 — BLINDED EXTERNAL ARCHITECTURE STRESS-TEST
STATUS: C...

👍0
Create a fun arcade racer in JS. The game should be set in a...

👍0
Necip Fazıl Kısakürek'in şiir üslubundan esinlenerek, gurbet...

👍0
лсл
даала

👍0
관리자가 알아야 할 10가지 원칙

👍0
Script

👍0
A vibrant, colorful scene featuring a monitor displaying a f...

👍0
Protocolo de Avaliação de Estresse Cognitivo e Conformidade Estrutural em Modelos de Linguagem (LLMs)
Trata-se de um prompt de alta complexidade projetado para testar os limites operacionais de um Modelo de Linguagem de Grande Porte em ambiente sem anexos. O objetivo é mensurar a capacidade do sistema de executar raciocínio transdisciplinar, manter a consistência de persona, aderir estritamente a múltiplos formatos de saída simultâneos (soneto, tabela Markdown, pseudocódigo e JSON) e respeitar restrições negativas rigorosas. A tarefa serve como um diagnóstico preciso para expor eventuais falhas de atenção, alucinações semânticas ou degradação na conformidade instrucional do modelo avaliado.