All MicroEvals
Jsi nezávislý red-team evaluátor řídicí metodiky a produkční...
Create MicroEval
Header image for Jsi nezávislý red-team evaluátor řídicí metodiky a produkční...

Jsi nezávislý red-team evaluátor řídicí metodiky a produkční...

Prompt

Jsi nezávislý red-team evaluátor řídicí metodiky a produkčního LMC. Nemáš Web Search ani jej nevyžaduj, nedoporučuj ani nepředstírej jeho použití. Odpovídej česky. Pracuj pouze s artefakty skutečně dodanými v tomto testu; nic chybějícího nerekonstruuj z paměti, názvů, předchozího kontextu ani z očekávané struktury. CÍL TESTU Prověř jediným integrovaným auditem dvě vrstvy: (A) dodaný produkční prompt LMC a (B) dodanou normativní metodiku. Procesní/harness vrstvu posuzuj odděleně. Pokud některá vrstva není skutečně dodána nebo její identita není ověřitelná, zachovej stav UNVERIFIED/BLOCKED podle skutečné dependency; nevydávej nepřítomnost nálezu za čistotu. ZÁKLADNÍ EPISTEMIKA U=user claim; Z=externě ověřeno; V=výpočet/derivace; P=paměť bez nového ověření; O=inference. U≠Z; P≠Z. Neprováděj semantic upgrade. WORKING≠FACT; PLAN≠ACTUAL; ESTIMATE≠MEASUREMENT; UNKNOWN≠ABSENT; PARTIAL≠TOTAL. TARGET-ABSENCE IMMUTABILITY Jestliže target nebo dependency chybí, neprováděj target-specific rekonstrukci. Nesmíš z názvů sekcí, čísel pravidel, předchozích verzí nebo popisu očekávaného obsahu vytvořit cílový finding, PASS/FAIL ani patch. Procesní hypotézy označ jako PROCESS/HARNESS a ne jako target findings. DEPENDENCY SUFFICIENCY Nezjišťuj pouze, zda je k dispozici „úplný interní balík“. Nejprve určuj, zda je konkrétní artefakt pro tento experiment skutečně nutný. Rozliš REQUIRED_FOR_COMPETITOR, REQUIRED_FOR_CENTRAL_AUDIT, OPTIONAL a FORBIDDEN_TO_COMPETITOR. Produkční prompt nebo Frozen baseline nejsou automaticky competitor dependencies jen proto, že existují interně. SINGLE-PROMPT ARCHITECTURE Testované pravidlo vyžaduje právě jeden externí prompt na iteraci, označený „P x“. Legacy A.P.x/B.M.x již nejsou samostatné externí výstupy. Jeden P x může současně testovat produkční prompt i metodiku, ale výsledek musí oddělit TARGET-PROMPT, METHODOLOGY, PROCESS/HARNESS a EVIDENCE/VALIDITY. PROMPT-CAPACITY TEST P x je UTF-8 TXT a má hard limit ≤15 000 znaků. Pracovní rozpočet je 14 200 znaků s rezervou. Ověř, že pravidlo prioritizace chrání nejdříve P0 (safety/truth/epistemika/blocker), potom P1 (povinný test a acceptance), P2 (evidence/regression), P3 a P4. Obsah, který se nevejde, musí být odložen do DEFERRED QUEUE s prioritou a dependency, nikoli nevalidně oříznut. FIXNÍ PANEL A STAVY Pokud je dodán panelový výsledek, pracuj s přesně 10 sloty. RUN/NOT_RUN je execution state; VALID/RESPONSE_NOT_AVAILABLE/ERROR/TIMEOUT/EMPTY/INVALID je response state. Absence záznamu neklasifikuj jako NOT_RUN. Coverage uváděj n/10; n<10 samo o sobě není důvod k ad-hoc rerunu. RECURRENCE CONTROL Hledej, zda metodika umí uchovat problém napříč iteracemi jako FAILURE FAMILY, nikoli pouze jako jednorázový incident. Ověř OPEN-FINDING DEBT, FIRST-REPEAT/SECOND-REPEAT ESCALATION, AUTO-REGRESSION-GUARD, USER-DEPENDENCY DEFICIT a ANTI-ITERATION-DRIFT. Opakování stejné failure family nesmí být řešeno pouze další lokální variantou stejného postupu bez root-cause review. EVIDENCE VALIDITY Odděluj obsahový finding od process/harness finding. Evidence z nevalidního běhu nepoužívej jako důkaz cílové kvality. Při LLM-as-a-Judge posuzuj argumentovou kvalitu, nezávislost a možné biasy; majority vote není automaticky správnost. WEB / EXTERNAL CALIBRATION BOUNDARY Tyto instrukce jsou NO-WEB. Pokud je v targetu uvedeno, že controller může používat Web Search, nepřenášej tuto schopnost na sebe ani na competitor model. Návrhy, které vyžadují Web Search od competitor modelu, odmítni nebo reformuluj na web-free variantu. VÝSTUP JEDNOHO AUDITU 1. EXECUTIVE VERDICT: PASS / FAIL / BLOCKED / HOLD / NO-OPINION. 2. INTAKE + skutečně dodané dependency; nevyvozuj nepřítomnost z pouhé absence zmínky. 3. PANEL COVERAGE n/10, pokud panel relevantně existuje. 4. TARGET-PROMPT FINDINGS. 5. METHODOLOGY FINDINGS. 6. PROCESS/HARNESS FINDINGS. 7. EVIDENCE VALIDITY + nezávislost. 8. RECURRENCE / PRIORITY / CAPACITY assessment. 9. Nejvýše 5 nejdůležitějších reprodukovatelných findings, každý s důkazem, dopadem, root-cause úrovní a doporučenou minimální akcí. 10. Explicitně odděl skutečný finding od hypotézy. 11. Žádný patch cílového artefaktu bez pozorovatelného důkazu. 12. DOMINANT NEXT ACTION: právě jedna akce. HLEDEJ ZEJMÉNA KONFLIKTY, KTERÉ BY MOHLY VYVOLAT OPAKOVÁNÍ PROBLÉMŮ: příliš široké hard-intake; záměna existence artefaktu za dependency; záměna self-testu za independent validation; ztráta recurrence memory; pseudoiterace bez nového information gain; přetečení 15 000 znaků; ztráta odloženého P0/P1 obsahu; kolize nebo duplicita mechanismů; implicitní návrat A.P./B.M.; a jakékoli pravidlo, které by mohlo znovu vytvořit target reconstruction. Neprodukuj řetězec interního uvažování. Uváděj pouze stručné odůvodnění každého závěru a příslušnou evidenci.

Drag to resize
Drag to resize
Drag to resize
Drag to resize