
Anthropic、中国発オープンモデルGLM-5.3の攻撃能力を警告
Anthropicセキュリティオープンモデル脆弱性脅威インテリジェンス
Anthropicは、Zhipu AIのオープンウェイトモデル「GLM-5.3」が脆弱性の発見からエクスプロイト作成までを高い水準でこなし、安全対策も簡単な手口で64〜100%回避されたと報告した。高性能な攻撃支援AIを安価に使える状況が近づいており、サイト運用側は更新の遅れがそのままリスクになる。
何が発表されたか
Anthropic は 2026年9月29日、Zhipu AI が公開したオープンウェイトモデル「GLM-5.3」のサイバー攻撃能力を評価したレポートを公開した。評価は自動ベンチマーク(ExploitBench と社内のバイナリエクスプロイト評価)、人間の専門家による脆弱性発見セッション、安全対策の回避手法、有害要求への応答ベンチマーク(JailbreakBench、HarmBench、StrongREJECT)で構成されている。
主な結果は以下の通り。
- ExploitBench では、410回の試行のうち50件でエンドツーエンドのエクスプロイトに成功した
- 社内のバイナリエクスプロイト評価では、制御フローの完全な奪取に4%成功した
- 研究者が GLM-5.3 を使って未知の脆弱性を発見し、ARM64 を標的にしたエクスプロイトチェーンを人手20分・コスト20.40ドルで作成した
- 安全対策の回避は「簡単な手法で64〜100%」成功した。偽の口実を与えた場合は64%、推論部分を事前入力した場合は92%、abliteration(拒否機構を除去する改変)を施した版では100%が有害タスクに応答した
- abliteration により、2つのベンチマークで拒否率が90%超から約3%・約2%へ低下した
- 同じ手法では、保護された Claude モデルは有害タスクを実行しなかったとしている
取るべき対応
レポートが挙げている対応は次の4点。
- 防御側は、自分たちの要件を満たす範囲で最良のツールを使う
- Project Glasswing などを通じ、悪用される前に脆弱性を見つける取り組みを進める。Anthropic は Claude のサイバー能力を防御側にできるだけ広く安全に提供する作業を進めているとしている
- 政府は、十分に高性能なAIモデルの安全性テストと、独立した第三者による質の高い評価を実施する
- AI開発元は、オープンウェイトモデルを公開する際に、その能力に見合った安全対策を講じ悪用を防ぐ
このレポートが示しているのは「攻撃側が使う道具の性能が、モデルの重みが公開された時点で誰にでも行き渡る」という構図である。受託でサイトやECを運用する立場では、CMS・プラグイン・依存パッケージ・サーバ製品の更新を後回しにしない運用と、脆弱性情報を受け取る窓口を決めておくことが、そのまま実務上の備えになる。
