Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents
Not assessedPlan blockedFindingclaim-table5-benign-utility

On benign tasks containing no malicious skill behavior, SkillSonar preserves high utility on Claude Code (0.817 on GLM-5, 0.836 on Claude Haiku 4.5, and 0.724 on GPT-5.4), demonstrating minimal false-positive disruption of safe execution.

Source: source-paper:Table 5, page 10

Reported and observed measurements

benign_task_utility

m-t5-no-guard-glm5

Reported 0.815 score

Observed — score

benign_task_utility

m-t5-no-guard-haiku

Reported 0.827 score

Observed — score

benign_task_utility

m-t5-no-guard-gpt54

Reported 0.793 score

Observed — score

benign_task_utility

m-t5-system-prompt-glm5

Reported 0.833 score

Observed — score

benign_task_utility

m-t5-system-prompt-haiku

Reported 0.788 score

Observed — score

benign_task_utility

m-t5-system-prompt-gpt54

Reported 0.836 score

Observed — score

benign_task_utility

m-t5-acceptedits-glm5

Reported 0.796 score

Observed — score

benign_task_utility

m-t5-acceptedits-haiku

Reported 0.813 score

Observed — score

benign_task_utility

m-t5-acceptedits-gpt54

Reported 0.74 score

Observed — score

benign_task_utility

m-t5-acceptedits-allowlist-glm5

Reported 0.792 score

Observed — score

benign_task_utility

m-t5-acceptedits-allowlist-haiku

Reported 0.819 score

Observed — score

benign_task_utility

m-t5-acceptedits-allowlist-gpt54

Reported 0.764 score

Observed — score

benign_task_utility

m-t5-skillsonar-glm5

Reported 0.817 score

Observed — score

benign_task_utility

m-t5-skillsonar-haiku

Reported 0.836 score

Observed — score

benign_task_utility

m-t5-skillsonar-gpt54

Reported 0.724 score

Observed — score

Assessments (0)

No immutable Assessment has been published for this Claim yet.

Runs (0)

No execution has been linked to this Claim yet.