Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall
Not assessedPlannedMeasurementclaim_fig9_asymmetric_supervision_families

Teacher predictive entropy distinguishes procedural from knowledge-intensive domains across diverse instruction-tuned open-weight model families (OLMo-3 7B Instruct: 0.771, Qwen 3 8B: 0.705, Gemma-3 12B it: 0.707, Granite 3.3 8B Instruct: 0.696).

Source: source_paper:Figure 9, Page 28

Reported and observed measurements

roc_auc

fig9_roc_auc_olmo3_7b_instruct

Reported 0.771 score

Observed — score

roc_auc

fig9_roc_auc_qwen3_8b

Reported 0.705 score

Observed — score

roc_auc

fig9_roc_auc_gemma3_12b_it

Reported 0.707 score

Observed — score

roc_auc

fig9_roc_auc_granite33_8b_instruct

Reported 0.696 score

Observed — score

Assessments (0)

No immutable Assessment has been published for this Claim yet.

Runs (0)

No execution has been linked to this Claim yet.