Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall
尚未评估已列入计划指标结果claim_fig9_asymmetric_supervision_families

Teacher predictive entropy distinguishes procedural from knowledge-intensive domains across diverse instruction-tuned open-weight model families (OLMo-3 7B Instruct: 0.771, Qwen 3 8B: 0.705, Gemma-3 12B it: 0.707, Granite 3.3 8B Instruct: 0.696).

来源:source_paper:Figure 9, Page 28

报告指标与观测值

roc_auc

fig9_roc_auc_olmo3_7b_instruct

论文报告 0.771 score

实际观测 — score

roc_auc

fig9_roc_auc_qwen3_8b

论文报告 0.705 score

实际观测 — score

roc_auc

fig9_roc_auc_gemma3_12b_it

论文报告 0.707 score

实际观测 — score

roc_auc

fig9_roc_auc_granite33_8b_instruct

论文报告 0.696 score

实际观测 — score

Assessment(0)

这条 Claim 暂无已发布的不可变 Assessment。

关联运行(0)

这条 Claim 暂无关联执行。