Geometry of Divergence: Tracking Hidden-State Trajectories for Adaptive Multi-Turn Reasoning
尚未评估计划受阻研究发现claim-action-conditioned-triggers
Action-conditioned trigger policies exhibit domain-dependent performance: on Retail with Qwen3-14B, triggering on Read (0.393) and Write (0.381) outperforms Respond (0.290), whereas on Airline with Qwen3-14B, the ordering inverts, with Respond achieving 0.372 while Read achieves 0.352 and Write achieves 0.340.
来源:paper:Page 6, Section 6, Paragraph 'The effectiveness of action-conditioned triggers varies across tasks'
报告指标与观测值
task_reward
meas-action-retail-read
论文报告 0.393 fraction
实际观测 — fraction
task_reward
meas-action-retail-write
论文报告 0.381 fraction
实际观测 — fraction
task_reward
meas-action-retail-respond
论文报告 0.29 fraction
实际观测 — fraction
task_reward
meas-action-airline-respond
论文报告 0.372 fraction
实际观测 — fraction
task_reward
meas-action-airline-read
论文报告 0.352 fraction
实际观测 — fraction
task_reward
meas-action-airline-write
论文报告 0.34 fraction
实际观测 — fraction
Assessment(0)
这条 Claim 暂无已发布的不可变 Assessment。
关联运行(0)
这条 Claim 暂无关联执行。