Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall
尚未评估计划受阻研究发现claim_fig12_gradient_alignment_fkl_rkl

Forward KL consistently exhibits higher CE-KL gradient cosine alignment than Reverse KL across pre-training and mid-training, with the gap widening at higher alpha and later training steps.

来源:source_paper:Figure 12, Page 31

报告指标与观测值

这条 Claim 暂无结构化指标。

Assessment(0)

这条 Claim 暂无已发布的不可变 Assessment。

关联运行(0)

这条 Claim 暂无关联执行。