Geometry of Divergence: Tracking Hidden-State Trajectories for Adaptive Multi-Turn Reasoning
尚未评估计划受阻研究发现claim-action-conditioned-triggers

Action-conditioned trigger policies exhibit domain-dependent performance: on Retail with Qwen3-14B, triggering on Read (0.393) and Write (0.381) outperforms Respond (0.290), whereas on Airline with Qwen3-14B, the ordering inverts, with Respond achieving 0.372 while Read achieves 0.352 and Write achieves 0.340.

来源:paper:Page 6, Section 6, Paragraph 'The effectiveness of action-conditioned triggers varies across tasks'

报告指标与观测值

task_reward

meas-action-retail-read

论文报告 0.393 fraction

实际观测 — fraction

task_reward

meas-action-retail-write

论文报告 0.381 fraction

实际观测 — fraction

task_reward

meas-action-retail-respond

论文报告 0.29 fraction

实际观测 — fraction

task_reward

meas-action-airline-respond

论文报告 0.372 fraction

实际观测 — fraction

task_reward

meas-action-airline-read

论文报告 0.352 fraction

实际观测 — fraction

task_reward

meas-action-airline-write

论文报告 0.34 fraction

实际观测 — fraction

Assessment(0)

这条 Claim 暂无已发布的不可变 Assessment。

关联运行(0)

这条 Claim 暂无关联执行。