Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall
尚未评估计划受阻研究发现claim_fig12_gradient_alignment_fkl_rkl
Forward KL consistently exhibits higher CE-KL gradient cosine alignment than Reverse KL across pre-training and mid-training, with the gap widening at higher alpha and later training steps.
来源:source_paper:Figure 12, Page 31
报告指标与观测值
这条 Claim 暂无结构化指标。
Assessment(0)
这条 Claim 暂无已发布的不可变 Assessment。
关联运行(0)
这条 Claim 暂无关联执行。