MicroEvals
Run your prompts across multiple models to compare their performance.
Public evaluations
Showing 1401-1420 of 4627

👍0
DBD-Benchmark
A benchmark made specifically to test LLMs with common sense questions. Based on my alredy existing eval on huggingface: Martico2432/DBD-Benchmark

👍0
移动同步
移动对鼠标移动轨迹进行算法修正,提高追踪的稳定性
直线修正
在鼠标直线移动时修正轨迹偏差,清除偏移抖动
波浪修...

👍0
hey

👍0
dwdawewe

👍0
I need profitable binance trading bot code!

👍0
An online store with a Basra, Syria identity
personal experience

👍0
test

👍0
An astronomer observes that a planet rotates faster after a ...

👍0
Gptest

👍0
Funny Poems For Kids

👍0
Кто пишет таким же слогом и манерой письма в России из писат...

👍0
Hermes model eval for finance business

👍0
Rjrjrk
Rkrktk

👍0
Jsi expertní vědecký, medicínský a Evidence-Based Medicine a...

👍0
a man scared

👍0
grok vs dsv4

👍0
Statement 1 | A permutation that is a product of m even perm...

👍0
Jsi nezávislý red-team evaluátor řídicího promptu LLM. Odpov...

👍0
هذه محاكاة فقط.
أنت تعمل داخل Hermes Agent.
الأدوات المتاح...

👍0
Jsi expertní vědecký, medicínský a Evidence-Based Medicine a...