
ELYZA、商用可の推論モデル2種を公開 AI開発研究組織も設立
ELYZA日本語LLMオープンモデルAIエージェントHugging Face
KDDI傘下のELYZAが10月2日、「AIによるAI開発」を研究する組織「ELYZA RSI Research」の設立を発表し、推論モデル2種をHugging Faceで商用利用可能な形で公開した。あわせてカスタマーセンター業務向けの評価用ベンチマークもGitHubで公開。ハーネス改善の実験では完遂率が34.3%から52.9%に、推論コストは67%削減したとしている。
何が発表されたか
株式会社ELYZAが2026年10月2日、「AIによるAI開発」の研究を推進する組織 ELYZA RSI Research(RSI: 再帰的自己改善)の設立を発表した。あわせて基盤モデル・評価・自律改善に関する成果を公開している。
公開されたモデル(いずれも商用利用可能なライセンス、Hugging Face で配布)
ELYZA-Thinking-1.0-llm-jp-4-33b(33Bパラメータ)ELYZA-Thinking-1.0-llm-jp-4-32b-a3b(32Bパラメータ)
公開された評価ベンチマーク
- 「ELYZA Agent Tasks: Customer Service」— 音声・テキストに対応したカスタマーセンター業務向けの評価セット。GitHub(elyza-inc/elyza-agent-tasks-customer-service)で公開
実験で示された数値
- ハーネス(エージェントの実行基盤)改善の実験で、タスク成功率が 14.4ポイント〜27.2ポイント向上
- 完遂率は 34.3%から52.9%へ(18.6ポイント向上)
- 推論コストは 67%削減
開発者への影響
- 商用利用可能なライセンスで33B級の推論モデルが国内から出てきたことで、日本語のエージェント用途を自社環境で動かす選択肢が増える。外部APIに出せないデータを扱う案件で検討対象になる
- 注目すべきは、モデル単体ではなく「ハーネス側の改善で成功率とコストが大きく動いた」という結果が数値付きで出ている点。同じモデルでも、プロンプト・ツール設計・実行基盤の作り方で完遂率が34.3%から52.9%まで変わるという内容で、エージェント構築の投資先を考える材料になる
- カスタマーセンター業務の評価ベンチマークが公開されたことで、問い合わせ対応AIを導入する際に「どれくらい実務に耐えるか」を自前で測りやすくなる。音声・テキストの両方に対応している点も、電話対応を含む業務に当てはめやすい
- モデルは Hugging Face から取得できる。GPUの要件や推論環境のコストは各自の構成に依存するため、PoC前に見積もりが必要
試すなら
- まずは公開ベンチマークで自社の想定業務に近いタスクを定義し、既存の外部APIと比較する形が現実的
- 33B と 32B-a3b の2種が出ているため、求める精度と推論コストのバランスで選ぶ
