On benign tasks containing no malicious skill behavior, SkillSonar preserves high utility on Claude Code (0.817 on GLM-5, 0.836 on Claude Haiku 4.5, and 0.724 on GPT-5.4), demonstrating minimal false-positive disruption of safe execution.
来源:source-paper:Table 5, page 10
报告指标与观测值
benign_task_utility
m-t5-no-guard-glm5
论文报告 0.815 score
实际观测 — score
benign_task_utility
m-t5-no-guard-haiku
论文报告 0.827 score
实际观测 — score
benign_task_utility
m-t5-no-guard-gpt54
论文报告 0.793 score
实际观测 — score
benign_task_utility
m-t5-system-prompt-glm5
论文报告 0.833 score
实际观测 — score
benign_task_utility
m-t5-system-prompt-haiku
论文报告 0.788 score
实际观测 — score
benign_task_utility
m-t5-system-prompt-gpt54
论文报告 0.836 score
实际观测 — score
benign_task_utility
m-t5-acceptedits-glm5
论文报告 0.796 score
实际观测 — score
benign_task_utility
m-t5-acceptedits-haiku
论文报告 0.813 score
实际观测 — score
benign_task_utility
m-t5-acceptedits-gpt54
论文报告 0.74 score
实际观测 — score
benign_task_utility
m-t5-acceptedits-allowlist-glm5
论文报告 0.792 score
实际观测 — score
benign_task_utility
m-t5-acceptedits-allowlist-haiku
论文报告 0.819 score
实际观测 — score
benign_task_utility
m-t5-acceptedits-allowlist-gpt54
论文报告 0.764 score
实际观测 — score
benign_task_utility
m-t5-skillsonar-glm5
论文报告 0.817 score
实际观测 — score
benign_task_utility
m-t5-skillsonar-haiku
论文报告 0.836 score
实际观测 — score
benign_task_utility
m-t5-skillsonar-gpt54
论文报告 0.724 score
实际观测 — score
Assessment(0)
这条 Claim 暂无已发布的不可变 Assessment。
关联运行(0)
这条 Claim 暂无关联执行。