AGENTIC R AG-R1: Agentic Reinforcement Learning with Stack Memory for Multi-Step Reasoning, Retrieval and Memorizing
尚未评估计划受阻研究发现claim-main-benchmark
AGENTIC R AG-R1 reports higher or near-highest F1 than listed baselines across seven multi-hop, open-domain, and agentic QA benchmarks.
来源:paper-fixed:page 7, Table 1
报告指标与观测值
average F1
m-main-average
论文报告 33.55 percentage_points
实际观测 — percentage_points
F1
m-main-hotpot
论文报告 44 percentage_points
实际观测 — percentage_points
F1
m-main-7b-bamboogle
论文报告 49.21 percentage_points
实际观测 — percentage_points
Assessment(0)
这条 Claim 暂无已发布的不可变 Assessment。
关联运行(0)
这条 Claim 暂无关联执行。