Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall

公开
作者:Jacqueline HeHoward YenShuyue Stella LiMargaret LiHanqing ZengYinglong XiaBenyu ZhangZhuokai ZhaoQiang ZhangPang Wei KohLuke ZettlemoyerWen-tau Yih
更多
复制仓库链接

复现

优先展示覆盖情况与实测结果;需要审计时再打开运行记录和技术细节。

RunMatchRepeat

0/76

条结论获得证据支持

0

获得支持

0

受到挑战或冲突

0

遭到反驳

1

无法判定

75

尚未评估

支持性 Assessment

测量项已确认

Teacher predictive entropy distinguishes procedural domains (Math, FLAN) from knowledge-intensive domains (DCLM, Wikipedia, StackExchange, PeS2o) with high ROC AUC (0.744-0.826) across training stages (Base, SFT, DPO, Instruct) and model sizes (1B, 7B, 13B).

论文报告值

0.815 score

CiteArk 实测值

0.8079 score

差异 -0.0071

运行记录

每一行是一条真实执行记录;命令、日志、哈希和签名都收纳在详情中。

失败记录

按原因聚类的失败路径,复现前先看看别人踩过的坑。

数据获取1 次失败

结论—实验复现矩阵

逐个实验展示当前执行状态、阻塞原因、恢复动作和证据去向;技术执行与科研结论始终分开。

2 个目标·1 个已有证据·0 个进行中·1 个需处理

Mid-training ablation results for Always CE relative difference across Reasoning, Factual Recall, and Knowledge task groups.

信息不足claim_t3_always_ce0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage RLVR1 for 13b_rkd.

信息不足claim_t8_rlvr1_13b_rkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

The stage-dependent distillation tradeoff generalizes to the SmolLM family (SmolLM2 360M student, 1.7B Instruct teacher, SmolLM3 Stage-3 data), where mid-training KD exhibits the reasoning-recall deficit and Switch Distillation mitigates it.

信息不足claim_fig7_smollm_tradeoff_generalizability0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage RLVR1 for 13b_fkd.

信息不足claim_t8_rlvr1_13b_fkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage SFT for 13b_rkd.

信息不足claim_t8_sft_13b_rkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage SFT for 13b_sd.

信息不足claim_t8_sft_13b_sd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Factual acquisition stratification by teacher entropy quintile persists when using OLMo-2 1B Instruct and 13B Instruct teachers.

信息不足claim_fig10_factual_acquisition_1b_13b0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Teacher entropy under OLMo-2 7B Instruct strongly predicts factual acquisition under NTP: by the end of pre-training, the student learns 67% of Q1 facts vs 5% of Q5 facts; by mid-training initialization (4T tokens), 80% of Q1 facts are learned vs 7% of Q5 facts.

信息不足claim_fig4_factual_acquisition_quintiles0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage RLVR1 for ntp_shared.

信息不足claim_t8_rlvr1_ntp_shared0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage SFT for 7b_rkd.

信息不足claim_t8_sft_7b_rkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Switch Distillation (SD, q=20%, tau=2) downstream evaluation performance after mid-training with OLMo-2 13B Instruct teacher.

信息不足claim_t1_13b_sd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task performance and group macro-averages for Switch Distillation under routing threshold sweep 7b_q30.

信息不足claim_t4_7b_q300 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Per-task downstream accuracy for mid-training ablation random_routing using OLMo-2 7B Instruct teacher.

信息不足claim_t9_random_routing0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Per-task downstream accuracy for mid-training ablation teacher_top1 using OLMo-2 7B Instruct teacher.

信息不足claim_t9_teacher_top10 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Mid-training ablation results for Switch Distillation absolute macro-averages across Reasoning, Factual Recall, and Knowledge task groups.

信息不足claim_t3_sd_baseline0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage SFT for 7b_sd.

信息不足claim_t8_sft_7b_sd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task performance and group macro-averages for Switch Distillation under routing threshold sweep 13b_q10.

信息不足claim_t4_13b_q100 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage DPO for 7b_trkd.

信息不足claim_t8_dpo_7b_trkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Forward KL Distillation (FKD, alpha=0.5) downstream evaluation performance after mid-training with OLMo-2 7B Instruct teacher.

信息不足claim_t1_7b_fkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Forward KL consistently exhibits higher CE-KL gradient cosine alignment than Reverse KL across pre-training and mid-training, with the gap widening at higher alpha and later training steps.

信息不足claim_fig12_gradient_alignment_fkl_rkl0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Full downstream results after standard 4-stage post-training pipeline (SFT, DPO, RLVR1, RLVR2) for 7B TRKD post-training performance.

信息不足claim_t2_7b_trkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Teacher predictive entropy distinguishes procedural from knowledge-intensive domains across diverse instruction-tuned open-weight model families (OLMo-3 7B Instruct: 0.771, Qwen 3 8B: 0.705, Gemma-3 12B it: 0.707, Granite 3.3 8B Instruct: 0.696).

CiteArk 独立重建claim_fig9_asymmetric_supervision_families1 个方案0 次运行
科学结论尚未评估

Evaluate Teacher Supervision Asymmetry (ROC AUC) Across Model Families

exp_fig9_asymmetric_supervision_families1 次尝试
执行失败

下一步

需要人工核查失败原因和证据完整性。

查看局部证据路径展开
  1. 研究计划

    结论与实验绑定已建立

  2. 执行目标

    执行失败

  3. 运行尝试

    实验执行 · 进行中

  4. CAP 证据

    尚无已关联的不可变 Artifact

  5. 科学判断

    尚无 Assessment

历史任务未记录目标级资源要求

Full downstream results after standard 4-stage post-training pipeline (SFT, DPO, RLVR1, RLVR2) for 7B FKD post-training performance.

信息不足claim_t2_7b_fkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage DPO for 13b_sd.

信息不足claim_t8_dpo_13b_sd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Mid-training ablation results for Oracle Domain Routing relative difference across Reasoning, Factual Recall, and Knowledge task groups.

信息不足claim_t3_oracle_domain0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Gold-token probability, gradient attenuation relative to NTP, and factual recall deficits under KD hold consistently for OLMo-2 1B and 13B Instruct teachers.

信息不足claim_fig11_factual_recall_kd_analysis_1b_13b0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage RLVR1 for 7b_rkd.

信息不足claim_t8_rlvr1_7b_rkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Reverse KL Distillation (RKD, alpha=0.5) downstream evaluation performance after mid-training with OLMo-2 13B Instruct teacher.

信息不足claim_t1_13b_rkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage SFT for 7b_trkd.

信息不足claim_t8_sft_7b_trkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Mid-training ablation results for Teacher Top-1 Labels relative difference across Reasoning, Factual Recall, and Knowledge task groups.

信息不足claim_t3_teacher_top10 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage SFT for 13b_fkd.

信息不足claim_t8_sft_13b_fkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Per-task downstream accuracy for mid-training ablation oracle_domain using OLMo-2 7B Instruct teacher.

信息不足claim_t9_oracle_domain0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Full downstream results after standard 4-stage post-training pipeline (SFT, DPO, RLVR1, RLVR2) for 13B FKD post-training performance.

信息不足claim_t2_13b_fkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task performance and group macro-averages for Switch Distillation under routing threshold sweep 7b_q10.

信息不足claim_t4_7b_q100 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Full downstream results after standard 4-stage post-training pipeline (SFT, DPO, RLVR1, RLVR2) for 13B TRKD post-training performance.

信息不足claim_t2_13b_trkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Full downstream results after standard 4-stage post-training pipeline (SFT, DPO, RLVR1, RLVR2) for 7B RKD post-training performance.

信息不足claim_t2_7b_rkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Switch Distillation substantially accelerates reasoning acquisition during mid-training, surpassing the final 60B-token NTP reasoning macro-average within 2.5B tokens (24x fewer tokens), while standard FKD requires 5.0B tokens (12x fewer).

信息不足claim_fig13_switch_distillation_acceleration0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage RLVR1 for 7b_fkd.

信息不足claim_t8_rlvr1_7b_fkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage DPO for 13b_fkd.

信息不足claim_t8_dpo_13b_fkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Switch Distillation (SD, q=20%, tau=2) downstream evaluation performance after mid-training with OLMo-2 7B Instruct teacher, demonstrating substantial gains on reasoning while maintaining factual recall.

信息不足claim_t1_7b_sd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage DPO for 13b_rkd.

信息不足claim_t8_dpo_13b_rkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Token-Routing Knowledge Distillation (TRKD) downstream evaluation performance after mid-training with OLMo-2 7B Instruct teacher.

信息不足claim_t1_7b_trkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Forward KL Distillation (FKD, alpha=0.5) downstream evaluation performance after mid-training with OLMo-2 13B Instruct teacher.

信息不足claim_t1_13b_fkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Standard Next-Token Prediction (NTP) baseline downstream evaluation performance after 60B mid-training tokens across 15 tasks covering Reasoning, Factual Recall, and Knowledge & Commonsense.

信息不足claim_t1_ntp0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage SFT for ntp_shared.

信息不足claim_t8_sft_ntp_shared0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Token-Routing Knowledge Distillation (TRKD) downstream evaluation performance after mid-training with OLMo-2 13B Instruct teacher.

信息不足claim_t1_13b_trkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Lower teacher predictive entropy corresponds to substantially higher teacher top-1 agreement with the ground-truth token across all data domains and teacher sizes.

信息不足claim_fig3_top1_agreement_entropy0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage DPO for 7b_rkd.

信息不足claim_t8_dpo_7b_rkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Full downstream results after standard 4-stage post-training pipeline (SFT, DPO, RLVR1, RLVR2) for 13B Switch Distillation post-training performance.

信息不足claim_t2_13b_sd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Higher teacher entropy corresponds to strictly lower gold-token probability, attenuates the gold-token gradient relative to NTP (reaching ~0.5x NTP for Q5 facts), and produces larger downstream factual recall deficits.

信息不足claim_fig5_gradient_attenuation_factual_supervision0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage DPO for 7b_sd.

信息不足claim_t8_dpo_7b_sd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Across distillation strengths alpha in [0.0, 1.0], KL directions (forward and reverse), and teacher sizes (1B, 7B, 13B), mid-training distillation traces a reasoning-recall frontier that falls below NTP, which Switch Distillation mitigates.

信息不足claim_fig2_reasoning_recall_tradeoff_sweep0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage DPO for ntp_shared.

信息不足claim_t8_dpo_ntp_shared0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage SFT for 13b_trkd.

信息不足claim_t8_sft_13b_trkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Knowledge distillation generally improves reasoning, but its effect on factual recall changes across training stages: during pre-training, distillation improves both reasoning and factual recall over NTP, whereas during mid-training it improves reasoning at the expense of factual recall.

信息不足claim_fig1_reasoning_recall_stage_dependence0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task performance and group macro-averages for Switch Distillation under routing threshold sweep 13b_q30.

信息不足claim_t4_13b_q300 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage RLVR1 for 7b_sd.

信息不足claim_t8_rlvr1_7b_sd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task performance and group macro-averages for Switch Distillation under routing threshold sweep 13b_q20.

信息不足claim_t4_13b_q200 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Mid-training ablation results for Switch Distillation with FKL relative difference across Reasoning, Factual Recall, and Knowledge task groups.

信息不足claim_t3_sd_fkl0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage DPO for 13b_trkd.

信息不足claim_t8_dpo_13b_trkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Full downstream results after standard 4-stage post-training pipeline (SFT, DPO, RLVR1, RLVR2) for 7B Switch Distillation post-training performance.

信息不足claim_t2_7b_sd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Reverse KL Distillation (RKD, alpha=0.5) downstream evaluation performance after mid-training with OLMo-2 7B Instruct teacher.

信息不足claim_t1_7b_rkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage SFT for 7b_fkd.

信息不足claim_t8_sft_7b_fkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage RLVR1 for 13b_sd.

信息不足claim_t8_rlvr1_13b_sd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Per-task downstream accuracy for mid-training ablation sd_fkl using OLMo-2 7B Instruct teacher.

信息不足claim_t9_sd_fkl0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Full downstream results after standard 4-stage post-training pipeline (SFT, DPO, RLVR1, RLVR2) for 13B RKD post-training performance.

信息不足claim_t2_13b_rkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Mid-training ablation results for Random Routing relative difference across Reasoning, Factual Recall, and Knowledge task groups.

信息不足claim_t3_random_routing0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage RLVR1 for 7b_trkd.

信息不足claim_t8_rlvr1_7b_trkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Per-task downstream accuracy for mid-training ablation teacher_correct using OLMo-2 7B Instruct teacher.

信息不足claim_t9_teacher_correct0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task performance and group macro-averages for Switch Distillation under routing threshold sweep 7b_q20.

信息不足claim_t4_7b_q200 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Full downstream results after standard 4-stage post-training pipeline (SFT, DPO, RLVR1, RLVR2) for NTP post-training baseline performance.

信息不足claim_t2_ntp_shared0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Mid-training ablation results for Teacher-Correct Routing relative difference across Reasoning, Factual Recall, and Knowledge task groups.

信息不足claim_t3_teacher_correct0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Per-task downstream accuracy for mid-training ablation always_ce using OLMo-2 7B Instruct teacher.

信息不足claim_t9_always_ce0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage RLVR1 for 13b_trkd.

信息不足claim_t8_rlvr1_13b_trkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Downstream task evaluation after post-training stage DPO for 7b_fkd.

信息不足claim_t8_dpo_7b_fkd0 个方案0 次运行
科学结论尚未评估

这条结论尚无可执行实验方案。

Teacher predictive entropy distinguishes procedural domains (Math, FLAN) from knowledge-intensive domains (DCLM, Wikipedia, StackExchange, PeS2o) with high ROC AUC (0.744-0.826) across training stages (Base, SFT, DPO, Instruct) and model sizes (1B, 7B, 13B).

CiteArk 独立重建claim_fig8_asymmetric_supervision_stages1 个方案1 次运行
科学结论无法判定

Evaluate Teacher Supervision Asymmetry (ROC AUC) Across Training Stages

exp_fig8_asymmetric_supervision_stages2 次尝试
证据已发布

下一步

执行链路已完成;继续查看科学 Assessment。

查看局部证据路径展开
  1. 研究计划

    结论与实验绑定已建立

  2. 执行目标

    证据已发布

  3. 运行尝试

    证据发布 · 已完成

  4. CAP 证据

    1 个不可变 Artifact

  5. 科学判断

    已有评估但无法判定

历史任务未记录目标级资源要求