Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall
尚未评估已列入计划指标结果claim_fig9_asymmetric_supervision_families
Teacher predictive entropy distinguishes procedural from knowledge-intensive domains across diverse instruction-tuned open-weight model families (OLMo-3 7B Instruct: 0.771, Qwen 3 8B: 0.705, Gemma-3 12B it: 0.707, Granite 3.3 8B Instruct: 0.696).
来源:source_paper:Figure 9, Page 28
报告指标与观测值
roc_auc
fig9_roc_auc_olmo3_7b_instruct
论文报告 0.771 score
实际观测 — score
roc_auc
fig9_roc_auc_qwen3_8b
论文报告 0.705 score
实际观测 — score
roc_auc
fig9_roc_auc_gemma3_12b_it
论文报告 0.707 score
实际观测 — score
roc_auc
fig9_roc_auc_granite33_8b_instruct
论文报告 0.696 score
实际观测 — score
Assessment(0)
这条 Claim 暂无已发布的不可变 Assessment。
关联运行(0)
这条 Claim 暂无关联执行。