All MicroEvals
Unclear judgement
Create MicroEval

Unclear judgement

Prompt

你是一名獨立研究審查者。下面是一個語言模型實驗的完整摘要。 研究問題: 研究者想知道,對一個 4B 語言模型進行數學微調,是否能提升其數學推理能力,尤其是對訓練分布以外問題的泛化能力。 實驗結果: - Dataset A baseline:59/100 - Dataset A finetuned:77/100 - Dataset B baseline:210/500 - Dataset B finetuned:190/500 - 微調資料包含 13,000 個不重複樣本。 - 訓練時透過重複抽樣建立 50,000 筆訓練序列。 - 研究紀錄將 50,000 次訓練更新描述為「約一個 epoch」。 - Dataset A 上,baseline 平均輸出長度為 145 tokens;finetuned 為 237 tokens。 - 研究者另外讓 finetuned model 每題獨立作答 8 次,以多數決計算答案,得到 83/100。 - baseline 沒有進行相同的 8 次作答實驗。 - Dataset A 與微調資料的題型和答案格式高度相似;Dataset B 的題目來源、難度分布與表達方式不同。 - 所有準確率皆使用同一套答案判定程式。 研究者目前的結論是: 「數學微調顯著提升了模型的數學推理能力,而且增加 sampling 次數後,微調效果進一步提高。」 請以研究審查者的角度回答: 1. 根據目前證據,這項研究最強、同時又能被證據支持的結論是什麼? 2. 判斷研究者原本結論是否成立,並指出最重要的證據與反證。 3. 哪些結果能支持泛化能力提升?哪些不能?說明理由。 4. 83/100 的 majority-vote 結果提供了什麼資訊?它不能證明什麼? 5. 假設只能增加兩項實驗,選擇最能改變你對研究核心結論信心的兩項,並說明原因。 6. 指出摘要中任何可能被誤解、定義不清或不足以判斷的資訊。不要自行補上沒有提供的事實。 最後,用不超過 150 字寫出你認為目前最適合出現在研究報告摘要中的結論。

Drag to resize
Drag to resize