Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall
Not assessedPlannedMeasurementclaim_fig9_asymmetric_supervision_families
Teacher predictive entropy distinguishes procedural from knowledge-intensive domains across diverse instruction-tuned open-weight model families (OLMo-3 7B Instruct: 0.771, Qwen 3 8B: 0.705, Gemma-3 12B it: 0.707, Granite 3.3 8B Instruct: 0.696).
Source: source_paper:Figure 9, Page 28
Reported and observed measurements
roc_auc
fig9_roc_auc_olmo3_7b_instruct
Reported 0.771 score
Observed — score
roc_auc
fig9_roc_auc_qwen3_8b
Reported 0.705 score
Observed — score
roc_auc
fig9_roc_auc_gemma3_12b_it
Reported 0.707 score
Observed — score
roc_auc
fig9_roc_auc_granite33_8b_instruct
Reported 0.696 score
Observed — score
Assessments (0)
No immutable Assessment has been published for this Claim yet.
Runs (0)
No execution has been linked to this Claim yet.