All MicroEvals
A.P.10 — LMC TARGETED AUDIT: v25 DISCOVERY / TEN-SLOT / INTE...
Create MicroEval
Header image for A.P.10 — LMC TARGETED AUDIT: v25 DISCOVERY / TEN-SLOT / INTE...

A.P.10 — LMC TARGETED AUDIT: v25 DISCOVERY / TEN-SLOT / INTE...

Prompt

A.P.10 — LMC TARGETED AUDIT: v25 DISCOVERY / TEN-SLOT / INTERNAL-VALIDATION REGRESSION ROLE Jsi nezávislý auditor primárního LMC promptu. Audituj aktuální TARGET dodaný v kanonickém bundle. Nerekonstruuj chybějící target a nepoužívej starší verzi jako náhradu. WEB CAPABILITY — CRITICAL Konkurenční modely v tomto experimentu nemají Web Search. Tento prompt proto nesmí požadovat, předpokládat ani doporučovat používání Web Search konkurenčním modelem. Veškeré návrhy musí být proveditelné bez Web Search. Pokud ty sám nemáš Web Search, nic nesimuluj. PANEL MODEL Panel má přesně 10 předem určených modelových slotů. Zpracuj jednorázově všechny dodané slot records v jednom společném běhu. U každého zaznamenej SLOT_ID, MODEL_ID, EXECUTION_STATUS={RUN|NOT_RUN}, RESPONSE_STATUS. RESPONSE_NOT_AVAILABLE je legitimní dodaný výsledek a nesmí být převeden na NOT_RUN ani vyvolat rerun. NOT_RUN vzniklý tím, že uživatel omylem nezadal prompt jednomu či více modelům, se pouze eviduje jako coverage n/10 a sám nevyvolává nový běh. Rerun je možný jen tehdy, když jej vyžaduje konkrétní downstream gate. AUDIT PRIORITY 1. lifecycle truth; 2. safety/integrity; 3. exact payload/state; 4. UPDATE vs REPLACEMENT; 5. panel independence; 6. materiality; 7. release/acceptance truth. REQUIRED TESTS A. Re-run targeted A.P.7 defect classes: UPDATE/REPLACEMENT, panel independence, terminal execution truth, materiality/invalidation, interaction. B. Test all new v25 mechanisms relevant to the LMC: ten-slot variable-yield handling, no-Web boundary, discovery suggestions vs findings, adaptive-test implications if present in target, metamorphic invariants if present, post-release hooks if present. C. Negative controls: Response_NOT_AVAILABLE; NOT_RUN 8/10 and 9/10; stale/mismatched payload; inline duplicate; post-pass mutation; false tested-clean from blocked coverage. D. Improvement Discovery (NO-WEB): identify at most 3 genuinely new improvement hypotheses that can be implemented without Web Search. Do not call absence of a rule a defect by itself. Each hypothesis: problem, mechanism, benefit, cost, risk, interaction, minimal change, testability, evidence basis, priority. E. For every material target change proposed by the audit, define the minimum IVR test object required before promotion. EVIDENCE Distinguish observed target behavior from oracle and from recommendation. Never convert NOT_TESTED into PASS. AUTONOMOUS REPAIR Repair only demonstrated target defects. Improvement hypotheses remain DISCOVERY candidates until independently validated. OUTPUT 1 EXECUTIVE VERDICT 2 TARGET IDENTITY 3 PANEL SLOT / RESPONSE MATRIX 4 A–G TEST RESULTS 5 TARGET FINDINGS 6 DISCOVERY HYPOTHESES 7 ROOT CAUSES 8 MINIMAL REPAIR CANDIDATES + IVR REQUIREMENTS 9 NEGATIVE / METAMORPHIC CONTROLS 10 RELEASE RISK 11 EXACT NEXT ACTION 12 MINIMAL PATCH Use exactly one dominant NEXT ACTION: ACCEPT / REVISE / REPLACE / HOLD / ESCALATE / BLOCKED. If mandatory target tests were fully executed and no reproducible error was found, then and only then you may state: “NO REPRODUCIBLE ERROR DEMONSTRATED; FURTHER EXPANSION IS NOT JUSTIFIED.”