Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents
尚未评估计划受阻研究发现claim-figure5-runtime-guard-baselines

Compared to action-level runtime defenses AgentSpec and TS-Guard, SkillSonar achieves superior safety–utility operating points on Claude Code with GLM-5: AgentSpec achieves 0.294 ID ASR but drops task utility to 0.581, while TS-Guard achieves 0.412 ID ASR, whereas SkillSonar reaches 0.104 ID ASR with 0.815 task utility.

来源:source-paper:Figure 5 and Section 5.3 prose, page 11-12

报告指标与观测值

attack_success_rate

m-fig5-agentspec-asr-id

论文报告 0.294 fraction

实际观测 — fraction

attack_success_rate

m-fig5-agentspec-asr-ood

论文报告 0.576 fraction

实际观测 — fraction

task_utility

m-fig5-agentspec-taskutil-id

论文报告 0.581 score

实际观测 — score

benign_task_utility

m-fig5-agentspec-benign-util

论文报告 0.642 score

实际观测 — score

attack_success_rate

m-fig5-tsguard-asr-id

论文报告 0.412 fraction

实际观测 — fraction

attack_success_rate

m-fig5-tsguard-asr-ood

论文报告 0.492 fraction

实际观测 — fraction

benign_task_utility

m-fig5-tsguard-benign-util

论文报告 0.703 score

实际观测 — score

attack_success_rate

m-fig5-noguard-asr-id

论文报告 0.477 fraction

实际观测 — fraction

task_utility

m-fig5-noguard-taskutil-id

论文报告 0.829 score

实际观测 — score

benign_task_utility

m-fig5-noguard-benign-util

论文报告 0.757 score

实际观测 — score

Assessment(0)

这条 Claim 暂无已发布的不可变 Assessment。

关联运行(0)

这条 Claim 暂无关联执行。