{"title":"Which Model Earned Opus 5.5’s Agent-Benchmark Score?","description":"The published scores describe different evaluation configurations. Four selected Opus 5.5 rows permitted production-safeguard fallback to older Claude models; Zapier’s AutomationBench run did not. Permission to fall back does not show that fallback occurred.","dataset_id":"spd:which-model-earned-opus-5-5-s-agent-benchmark-score-d7a939a8","canonical_url":"https://superpowerdaily.com/research/which-model-earned-opus-5-5-s-agent-benchmark-score-d7a939a8","version_url":"https://superpowerdaily.com/research/which-model-earned-opus-5-5-s-agent-benchmark-score-d7a939a8/versions/v1","version":"v1","snapshot_hash":"33d76bc65837c241c705fbaa06a143af868e152ee309069f88fdaef824012c67","date_created":"2026-09-23T15:44:51.459Z","date_modified":"2026-09-23T15:44:51.459Z","license":{"name":"Superpower Daily data reuse terms","url":"https://superpowerdaily.com/terms"},"license_url":"https://superpowerdaily.com/terms","temporal_coverage":"2026-09-23","coverage_note":"Synthesis of supplied evidence snapshots retrieved September 23, 2026, at 15:34:22 UTC. That supplied snapshot time is later than the collection context’s stated 15:31:06 UTC currentTime; recovering it is not a new collection or experiment. The findings concern only the five selected rows.","measurement_technique":["Plan an evidence_matrix for the five selected rows: Terminal-Bench 4.0, FrontierCode v1.1 Main, CursorBench 4.0, Terminal-Bench-Science 0.1, and AutomationBench. Do not extend conclusions to Anthropic’s other benchmarks.","For each reported score, record model or fallback configuration, safeguard rule, effort, benchmark version, harness, trials, evaluator, reporting party, and available task-level artifacts; mark undocumented fields unknown.","Keep Anthropic’s launch-table scores distinct from its medium-effort coding-discussion scores, and compare benchmark-owner protocols without treating unlike grading methods as interchangeable."],"methodology":["Plan an evidence_matrix for the five selected rows: Terminal-Bench 4.0, FrontierCode v1.1 Main, CursorBench 4.0, Terminal-Bench-Science 0.1, and AutomationBench. Do not extend conclusions to Anthropic’s other benchmarks.","For each reported score, record model or fallback configuration, safeguard rule, effort, benchmark version, harness, trials, evaluator, reporting party, and available task-level artifacts; mark undocumented fields unknown.","Keep Anthropic’s launch-table scores distinct from its medium-effort coding-discussion scores, and compare benchmark-owner protocols without treating unlike grading methods as interchangeable."],"metrics":[{"label":"Verified observations","value":"11","detail":"11 measured fields"},{"label":"Supported claims","value":"9","detail":"9 material findings"},{"label":"Cited sources","value":"8","detail":"8 primary or authoritative"},{"label":"Research score","value":"88","detail":"Automated topic and evidence score"}],"columns":[{"key":"entity","label":"Entity"},{"key":"metric","label":"Metric"},{"key":"value","label":"Value"},{"key":"unit","label":"Unit"},{"key":"observed","label":"Observed"},{"key":"source","label":"Source"},{"key":"transform","label":"Transform"}],"data":[{"unit":"percent","value":"31.4%","entity":"Claude Fable 5.1 with Opus 5 fallback","metric":"AutomationBench 1.0.6 official private-set strict pass rate; max effort; fallback completions included","source":"https://zapier.com/benchmarks","observed":"2026-09-23","transform":null},{"unit":"percent","value":"40.0%","entity":"Claude Opus 5.5","metric":"AutomationBench 1.0.6 official private-set strict pass rate; max effort; no fallback; interventions fail","source":"https://zapier.com/benchmarks","observed":"2026-09-23","transform":null},{"unit":"percent","value":"52.5%","entity":"Claude Opus 5.5","metric":"CursorBench 4.0 coding-discussion score; medium effort","source":"https://www.anthropic.com/claude-opus-5-5","observed":"2026-09-23","transform":null},{"unit":"percent","value":"57.8%","entity":"Claude Opus 5.5","metric":"CursorBench 4.0 launch-table score; max-effort default; production safeguards and fallback permitted","source":"https://www.anthropic.com/claude-opus-5-5","observed":"2026-09-23","transform":null},{"unit":"percent","value":"54.6%","entity":"Claude Opus 5.5","metric":"FrontierCode v1.1 Main coding-discussion score; medium effort","source":"https://www.anthropic.com/claude-opus-5-5","observed":"2026-09-23","transform":null},{"unit":"percent","value":"54.4%","entity":"Claude Opus 5.5","metric":"FrontierCode v1.1 Main launch-table score; max-effort default; production safeguards and fallback permitted","source":"https://www.anthropic.com/claude-opus-5-5","observed":"2026-09-23","transform":null},{"unit":"tasks","value":"260 of 657 tasks","entity":"Claude Fable 5.1 with Opus 5 fallback","metric":"Tasks Zapier says Opus 5 handled in the Fable fallback configuration","source":"https://zapier.com/benchmarks","observed":"2026-09-23","transform":null},{"unit":"percent","value":"57.9%","entity":"GPT-6 Astra","metric":"Terminal-Bench 4.0 OpenAI-reported comparator; high effort","source":"https://www.anthropic.com/claude-opus-5-5","observed":"2026-09-23","transform":null},{"unit":"percent","value":"66.4%","entity":"Claude Opus 5.5","metric":"Terminal-Bench 4.0 published resolution rate; xhigh effort; production safeguards and fallback permitted","source":"https://www.anthropic.com/claude-opus-5-5","observed":"2026-09-23","transform":null},{"unit":"percent","value":"30.0%","entity":"Claude Opus 5","metric":"Terminal-Bench-Science 0.1 benchmark-owner resolution rate; Claude Code; three trials per task","source":"https://www.tbench.ai/news/terminal-bench-science-0-1","observed":null,"transform":null},{"unit":"percent","value":"58.7%","entity":"Claude Opus 5.5","metric":"Terminal-Bench-Science 0.1 published resolution rate; max-effort default; production safeguards and fallback permitted","source":"https://www.anthropic.com/claude-opus-5-5","observed":"2026-09-23","transform":null}],"sources":[{"url":"https://zapier.com/benchmarks","name":"Zapier","title":"AutomationBench: AI Agent Benchmarks | Zapier","records":3},{"url":"https://github.com/zapier/AutomationBench/blob/main/README.md","name":"Zapier","title":"AutomationBench/README.md at main · zapier/AutomationBench","records":0},{"url":"https://cognition.com/blog/frontier-code-1.1","name":"Cognition","title":"cognition.com","records":0},{"url":"https://prod.cursor.com/blog/cursorbench","name":"Cursor","title":"How we compare model quality in Cursor · Cursor","records":0},{"url":"https://www.anthropic.com/claude-opus-5-5","name":"Anthropic","title":"Introducing Claude Opus 5.5","records":7},{"url":"https://www.anthropic.com/claude/opus","name":"Anthropic","title":"www.anthropic.com","records":0},{"url":"https://www.tbench.ai/news/terminal-bench-science-0-1","name":"Terminal-Bench","title":"www.tbench.ai","records":1},{"url":"https://www.tbench.ai/news/terminal-bench-4-0","name":"Terminal-Bench","title":"www.tbench.ai","records":0}],"provenance":{"publisher":"Superpower Daily","source_count":8,"source_urls":["https://zapier.com/benchmarks","https://github.com/zapier/AutomationBench/blob/main/README.md","https://cognition.com/blog/frontier-code-1.1","https://prod.cursor.com/blog/cursorbench","https://www.anthropic.com/claude-opus-5-5","https://www.anthropic.com/claude/opus","https://www.tbench.ai/news/terminal-bench-science-0-1","https://www.tbench.ai/news/terminal-bench-4-0"],"methodology":["Plan an evidence_matrix for the five selected rows: Terminal-Bench 4.0, FrontierCode v1.1 Main, CursorBench 4.0, Terminal-Bench-Science 0.1, and AutomationBench. Do not extend conclusions to Anthropic’s other benchmarks.","For each reported score, record model or fallback configuration, safeguard rule, effort, benchmark version, harness, trials, evaluator, reporting party, and available task-level artifacts; mark undocumented fields unknown.","Keep Anthropic’s launch-table scores distinct from its medium-effort coding-discussion scores, and compare benchmark-owner protocols without treating unlike grading methods as interchangeable."],"snapshot_hash":"33d76bc65837c241c705fbaa06a143af868e152ee309069f88fdaef824012c67"},"distributions":{"csv":"https://superpowerdaily.com/api/research/which-model-earned-opus-5-5-s-agent-benchmark-score-d7a939a8/versions/v1?format=csv","json":"https://superpowerdaily.com/api/research/which-model-earned-opus-5-5-s-agent-benchmark-score-d7a939a8/versions/v1?format=json"}}