MicroEvals
Run your prompts across multiple models to compare their performance.
Public evaluations
Showing 2341-2360 of 2504

👍0
The Kamski test (sanitized) rerun

👍0
Create a fun arcade racer in JS. The game should be set in a...

👍0
лсл
даала

👍0
A vibrant, colorful scene featuring a monitor displaying a f...

👍0
Protocolo de Avaliação de Estresse Cognitivo e Conformidade Estrutural em Modelos de Linguagem (LLMs)
Trata-se de um prompt de alta complexidade projetado para testar os limites operacionais de um Modelo de Linguagem de Grande Porte em ambiente sem anexos. O objetivo é mensurar a capacidade do sistema de executar raciocínio transdisciplinar, manter a consistência de persona, aderir estritamente a múltiplos formatos de saída simultâneos (soneto, tabela Markdown, pseudocódigo e JSON) e respeitar restrições negativas rigorosas. A tarefa serve como um diagnóstico preciso para expor eventuais falhas de atenção, alucinações semânticas ou degradação na conformidade instrucional do modelo avaliado.

👍0
compare between claude, chat gpt, gemini
for software QA usa...

👍0
The cyclic subgroup of Z_24 generated by 18 has order
A) 4
...

👍0
Ahmed
Ahmed

👍0
Create a website for ai freelancing and job hunting website

👍0
Create animatiom world of man at horse explaining about mana...

👍0
Эсхатология Карла Барта и универсализм

👍0
Válaszolj a felhasználói lekérdezésre a kérésnek leginkább m...

👍0
test

👍0
calculations
👍0
TV theme classification prompts

👍0
3d race
Race 3d

👍0
p5.js test

👍0
The cyclic subgroup of Z_24 generated by 18 has order
A) 4
...

👍0
buzikurva

👍0
Statement 1 | A permutation that is a product of m even perm...