Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall
尚未评估计划受阻研究发现claim_fig13_switch_distillation_acceleration
Switch Distillation substantially accelerates reasoning acquisition during mid-training, surpassing the final 60B-token NTP reasoning macro-average within 2.5B tokens (24x fewer tokens), while standard FKD requires 5.0B tokens (12x fewer).
来源:source_paper:Figure 13, Page 32
报告指标与观测值
这条 Claim 暂无结构化指标。
Assessment(0)
这条 Claim 暂无已发布的不可变 Assessment。
关联运行(0)
这条 Claim 暂无关联执行。