MicroEvals
Public evaluations
Showing 3741-3760 of 4021

pythonraw

111

Melissa Cleary

Test sur 1 accord


Testing awarness

I want to use this evaluation to check how good is each tool for developing the project based on the java springboot.




This is a test for AI to evaluate precise spatial reasoning on a constrained 100×100 dot grid. The model must independently choose an appropriate letter-cell size, calculate character and line spacing, and accurately center three lines of text formed by connecting adjacent dots with straight line segments so that the phrase 'Hello Harry Potter, my name is Tom Marvolo Riddle' is legibly and symmetrically placed on the canvas.





даала



Trata-se de um prompt de alta complexidade projetado para testar os limites operacionais de um Modelo de Linguagem de Grande Porte em ambiente sem anexos. O objetivo é mensurar a capacidade do sistema de executar raciocínio transdisciplinar, manter a consistência de persona, aderir estritamente a múltiplos formatos de saída simultâneos (soneto, tabela Markdown, pseudocódigo e JSON) e respeitar restrições negativas rigorosas. A tarefa serve como um diagnóstico preciso para expor eventuais falhas de atenção, alucinações semânticas ou degradação na conformidade instrucional do modelo avaliado.
