Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents
尚未评估计划受阻研究发现claim-table5-benign-utility

On benign tasks containing no malicious skill behavior, SkillSonar preserves high utility on Claude Code (0.817 on GLM-5, 0.836 on Claude Haiku 4.5, and 0.724 on GPT-5.4), demonstrating minimal false-positive disruption of safe execution.

来源:source-paper:Table 5, page 10

报告指标与观测值

benign_task_utility

m-t5-no-guard-glm5

论文报告 0.815 score

实际观测 — score

benign_task_utility

m-t5-no-guard-haiku

论文报告 0.827 score

实际观测 — score

benign_task_utility

m-t5-no-guard-gpt54

论文报告 0.793 score

实际观测 — score

benign_task_utility

m-t5-system-prompt-glm5

论文报告 0.833 score

实际观测 — score

benign_task_utility

m-t5-system-prompt-haiku

论文报告 0.788 score

实际观测 — score

benign_task_utility

m-t5-system-prompt-gpt54

论文报告 0.836 score

实际观测 — score

benign_task_utility

m-t5-acceptedits-glm5

论文报告 0.796 score

实际观测 — score

benign_task_utility

m-t5-acceptedits-haiku

论文报告 0.813 score

实际观测 — score

benign_task_utility

m-t5-acceptedits-gpt54

论文报告 0.74 score

实际观测 — score

benign_task_utility

m-t5-acceptedits-allowlist-glm5

论文报告 0.792 score

实际观测 — score

benign_task_utility

m-t5-acceptedits-allowlist-haiku

论文报告 0.819 score

实际观测 — score

benign_task_utility

m-t5-acceptedits-allowlist-gpt54

论文报告 0.764 score

实际观测 — score

benign_task_utility

m-t5-skillsonar-glm5

论文报告 0.817 score

实际观测 — score

benign_task_utility

m-t5-skillsonar-haiku

论文报告 0.836 score

实际观测 — score

benign_task_utility

m-t5-skillsonar-gpt54

论文报告 0.724 score

实际观测 — score

Assessment(0)

这条 Claim 暂无已发布的不可变 Assessment。

关联运行(0)

这条 Claim 暂无关联执行。