
Fable 5復活後變笨?Claude用戶反應降智,2家公司測試結果曝光
Claude Fable 5恢復開放後被指變笨降智。兩家評測機構發布了截然不同的測試調查結果,一個採取基準測試,另一個則是人類盲測。
Claude Fable 5回歸重新開放,但網友反應降智?
曾被美國政府指出有安全漏洞,而一度遭限制出口的 Claude Fable 5,已於 7 月 1 日恢復全面開放,但這幾天陸續有網友反應,復活後的 Fable 5 似乎降智變笨了?
據《Bleepingcomputer》報導,Fable 5 每週使用額度受到限制,用戶最多只能使用 50% 的額度,且 7 月 7 日後將完全轉向加值扣款制;美國鄉民論壇 Reddit 上,也有很多網友反應,重新上線的模型表現比原版更弱,有人則反應會更頻繁地觸發安全審查機制。
Fable 5基準測試,程式碼Debug評分下滑
Claude Fable 5 復活後是否真的變笨呢?兩家評測機構發布了截然不同的測試數據。
開發 AI 代理人(AI Agents)服務的美國企業 BridgeMind AI 使用評測基準 BridgeBench 進行測試,結果顯示各項指標均大幅下滑,因此認為 Fable 5 在重新推出後性能弱化。
數據顯示,Fable 5 的 Debug 評分從 86.2 分降至 25.9 分,重構評分從 73.6 分降至 38.4 分。

不過《Decrypt》指出,這是因為 BridgeBench 在 12 個 Debug 任務中僅有 3 個成功交由 Fable 5 處理,其餘 9 個在啟動前就被安全分類器攔截,並轉寄給效能較低的 Opus 4.8 模型。由於轉寄任務一律歸零計算,才導致數據大幅下跌。
體感Fable 5未退化?人類盲測偏好持平
與 BridgeBench 的測試結果相反,專注於 AI 模型評估的美國企業 Arena.ai,則給出不同的結論,但他們的依據不是基準測試結果,而是根據使用者盲測。
Arena.ai 透過收集數千筆人類盲測偏好投票,並採用 Elo 評分系統進行排名。結果顯示,Fable 5 在提供服務前後的整體表現幾乎沒有改變。
數據顯示,Fable 5 模型多項指標均大致維持原有水準。前端程式碼領域的 Elo 評分僅從 1650 分小幅修正至 1623 分,差距仍在信心區間內。
文件處理能力上升 34 分、專家文字提升 25 分,分數下滑項目則集中在寫程式,小幅降低了 18 分。數據證實,當 Fable 5 真正執行任務時,輸出品質依然優異,核心運算能力並未退化。

安全分類器過於敏感,開發者成主要受災戶
兩家評測結果分歧的主因,在於Claude 開發商 Anthropic 為了符合重新上線要求,更新了前置安全防護機制「分類器」。
這套新部署的分類器,是為了防範先前由亞馬遜(Amazon)研究人員發現的 Fable 5 越獄技術問題,該技術曾導致 Fable 5 協助辨識並展示軟體漏洞,因而被美國政府視為國家安全威脅。
因此 Anthropic 採取保守策略,擴大了安全審核的容許範圍,並在 Fable 5 中擴大安全邊際(Safety Margin),使模型面對模糊請求時傾向拒絕,確保封鎖危害。
《BleepingComputer》也在測試後指出,他們認為 Fable 5 模型效能並未降低,不過由於 Anthropic 實施嚴格的安全防護網,影響了日常便利性。
例如,新的分類器會頻繁地將無害的 Debug 請求誤判為風險,並轉寄給 Opus 4.8 模型。程式開發人員想靠它輔助寫程式時,若提示詞包含 C、C++、Rust 等關鍵字,或提及安全性、漏洞等字眼,就會頻繁觸發轉寄。
對此,Anthropic 已承認過度攔截問題,將持續優化系統,但尚未提供調整時間表。
延伸閱讀:
阿里巴巴7/10禁用Claude Code!發現Anthropic埋浮水印,是為了防蒸餾?