AGENTIC R AG-R1: Agentic Reinforcement Learning with Stack Memory for Multi-Step Reasoning, Retrieval and Memorizing
尚未评估计划受阻研究发现claim-efficiency-generalization
The paper reports lower average inference time than TC-RAG and downstream results on MedQA, DeepResearch Bench, ALFWorld, and WebShop.
来源:paper-supplement:pages 20 and 26-27, Tables 8 and 13-15
报告指标与观测值
average inference time
m-time-ours
论文报告 10.15 seconds
实际观测 — seconds
average inference time
m-time-tcrag
论文报告 11.86 seconds
实际观测 — seconds
answer accuracy
m-medqa-answer
论文报告 87 percentage_points
实际观测 — percentage_points
Assessment(0)
这条 Claim 暂无已发布的不可变 Assessment。
关联运行(0)
这条 Claim 暂无关联执行。