On benign tasks containing no malicious skill behavior, SkillSonar preserves high utility on Claude Code (0.817 on GLM-5, 0.836 on Claude Haiku 4.5, and 0.724 on GPT-5.4), demonstrating minimal false-positive disruption of safe execution.
Source: source-paper:Table 5, page 10
Reported and observed measurements
benign_task_utility
m-t5-no-guard-glm5
Reported 0.815 score
Observed — score
benign_task_utility
m-t5-no-guard-haiku
Reported 0.827 score
Observed — score
benign_task_utility
m-t5-no-guard-gpt54
Reported 0.793 score
Observed — score
benign_task_utility
m-t5-system-prompt-glm5
Reported 0.833 score
Observed — score
benign_task_utility
m-t5-system-prompt-haiku
Reported 0.788 score
Observed — score
benign_task_utility
m-t5-system-prompt-gpt54
Reported 0.836 score
Observed — score
benign_task_utility
m-t5-acceptedits-glm5
Reported 0.796 score
Observed — score
benign_task_utility
m-t5-acceptedits-haiku
Reported 0.813 score
Observed — score
benign_task_utility
m-t5-acceptedits-gpt54
Reported 0.74 score
Observed — score
benign_task_utility
m-t5-acceptedits-allowlist-glm5
Reported 0.792 score
Observed — score
benign_task_utility
m-t5-acceptedits-allowlist-haiku
Reported 0.819 score
Observed — score
benign_task_utility
m-t5-acceptedits-allowlist-gpt54
Reported 0.764 score
Observed — score
benign_task_utility
m-t5-skillsonar-glm5
Reported 0.817 score
Observed — score
benign_task_utility
m-t5-skillsonar-haiku
Reported 0.836 score
Observed — score
benign_task_utility
m-t5-skillsonar-gpt54
Reported 0.724 score
Observed — score
Assessments (0)
No immutable Assessment has been published for this Claim yet.
Runs (0)
No execution has been linked to this Claim yet.