哪些研究结论真正可复现,直接看证据。
CiteArk 把论文编译成带签名的研究计划,在隔离环境中真实执行实验并公开全部证据——每个结果都能追溯到具体的代码、环境和签名证明。
本周研究动态
研究仓库
Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality
11 条结论 · 复现进行中
Knowledge Distillation During Mid-Training Favors Reasoning over Factual Recall
76 条结论 · 复现进行中
LongPIBench: A Long-Context Benchmark for Prompt Injection
5 条结论 · 复现进行中
最新复现结论
Teacher predictive entropy distinguishes procedural domains (Math, FLAN) from knowledge-intensive domains (DCLM, Wikipedia, StackExchange, PeS2o) with high ROC AUC (0.744-0.826) across training stages (Base, SFT, DPO, Instruct) and model sizes (1B, 7B, 13B).
✓ 获得支持0.815 → 0.8079
Teacher predictive entropy distinguishes procedural domains (Math, FLAN) from knowledge-intensive domains (DCLM, Wikipedia, StackExchange, PeS2o) with high ROC AUC (0.744-0.826) across training stages (Base, SFT, DPO, Instruct) and model sizes (1B, 7B, 13B).
✓ 获得支持0.77 → 0.7967
Teacher predictive entropy distinguishes procedural domains (Math, FLAN) from knowledge-intensive domains (DCLM, Wikipedia, StackExchange, PeS2o) with high ROC AUC (0.744-0.826) across training stages (Base, SFT, DPO, Instruct) and model sizes (1B, 7B, 13B).
✓ 获得支持0.744 → 0.7931
Teacher predictive entropy distinguishes procedural domains (Math, FLAN) from knowledge-intensive domains (DCLM, Wikipedia, StackExchange, PeS2o) with high ROC AUC (0.744-0.826) across training stages (Base, SFT, DPO, Instruct) and model sizes (1B, 7B, 13B).
✓ 获得支持0.748 → 0.7973
一份证据,两种读者
结构化结论、真实执行与签名证明——人可以直接读,智能体可以直接查。
结构化结论,而不是一整篇 PDF
每篇论文被拆解成带条件、带报告指标的结论,每条结论直接挂着实测值与证据状态。
隔离环境里的真实执行
复现在沙箱中运行,命令、日志、失败路径全部留存。
# environment pinned to commit
$ python citation.py --dataset reddit
✓ 91,832 samples · finished
$ cap attest --sign
✓ attestation signed
Agent API 与 MCP
智能体直接查询结论、证据与执行轨迹,不再解析 PDF。
GET /api/v1/claims
{
"assessment": "supports",
"reported": "94.9",
"observed": "95.0"
}
把验证徽章别在你的研究上
三环进度、覆盖分数与签名摘要可以嵌入论文页、README 与分享海报,任何人当场核对。
3/5Artifactsha256:e6d80d98…850a