30Bクラスのオープンモデルが相次ぎ登場 27Bが Opus 4.6 超えの報告も
技術関連ITmedia AI+
オープンモデルLLMローカル実行コストQwen
Meta・NVIDIA・Alibaba Cloud が8月中旬の9日間に相次いで300億パラメータ級のオープンウェイトモデルを公開した、と ITmedia が8月24日に報じた。国内では国立情報学研究所が「LLM-jp-4 33B」を追加。24GB VRAM のGPUで動く規模ながら、一部ベンチマークでフロンティアモデル超えの報告も出ている。
何が発表されたか
- ITmedia は 2026年8月24日、300億パラメータ級のオープンウェイトモデルが集中的に公開されている状況をまとめた。
- Meta、NVIDIA、Alibaba Cloud が8月中旬の9日間に、いずれも30Bクラスのオープンウェイトモデルを公開。国内では国立情報学研究所が330億パラメータの「LLM-jp-4 33B」を追加した。
- Alibaba の Qwen 3.8-27B は、ソフトウェア開発能力と競技プログラミングを測る一部ベンチマークで Anthropic の Claude Opus 4.6 のスコアを上回ったと報告されている。量子化すれば24GB VRAM のコンシューマ向けGPUで動作する。
- 各社が想定する用途は「常時稼働のAIエージェント」。定型処理は軽量モデルに任せ、複雑な問題だけ大型モデルに委ねる分業でコストとレイテンシを下げる。
- 背景には、高価なフロンティアモデルから安価な選択肢への移行圧力、ローカル実行によるAPI費用の削減と機微データの保護、オープンモデルを後押しする規制の流れがある。
- ただし性能の主張は自社測定が中心で、改善は特定ベンチマークに限られる点に留意が必要とされている。
開発者への影響
受託の現場でこの流れが効いてくるのは、「全部をフロンティアモデルのAPIに投げる」構成を見直せる余地が出てきたという点だ。商品説明の下書き、タグ付け、問い合わせの分類、コードの定型的な書き換え——このあたりは30Bクラスで十分足りることが多く、ここを分離できればAPI費用は目に見えて下がる。
ただし、フリーランス規模でローカル実行に踏み込むかは別の判断になる。24GB VRAM のGPUを用意し、量子化して運用し、モデル更新を追い続けるコストは小さくない。当面は、オープンモデルをホスティングしているAPI(推論専業クラウドなど)経由で試し、コストと品質の差を実測してから内製化を検討する順序が合理的だ。
一方で、機微データを外に出せない案件——医療、士業、自治体など——では、ローカル実行できる規模のモデルが実用水準に来たこと自体が提案の選択肢を増やす。「クラウドAIは使えない」で終わっていた相談を、もう一度検討できる状態になりつつある。
補足
本記事は ITmedia の解説記事に基づく。ベンチマークスコアは各社の自社測定であり、第三者による再現は限定的。
