Transformers、llama.cppの量子化モデルを直接実行可能に
Hugging FaceTransformersGGUFllama.cppローカルLLM
Hugging FaceがTransformersへのGGUF対応を発表した。llama.cppの量子化済みモデルを `from_pretrained` でそのまま読み込み、`generate()` やチャットテンプレートといった通常のTransformers APIで扱える。当面はApple SiliconのMPS環境とQwen3.5系が対象となる。
何が発表されたか
- GGUF形式の量子化モデルをTransformersから直接ロード可能に。
AutoModelForCausalLM.from_pretrained(repo, gguf_file="...Q4_K_M.gguf")の形で指定する。 - 読み込み後は
generate()、チャットテンプレート、評価用のワークフローなど既存のTransformers操作がそのまま使える。GGUF固有の設定は不要。 - Qwen3.5-4Bでの例として、Q6_K(3.53GB)、Q5_K_M(3.14GB)、Q4_K_M(2.74GB)、BF16(8.42GB)を提示。推奨の出発点はQ4_K_M。
- 制約として、パックされた推論はApple Silicon(MPS)のみ、対応アーキテクチャはQwen3.5と互換のQwen3.8系に限定、パディングを伴うバッチ処理は性能が落ちる。
- 対応カーネルがないモデルは、フル精度への逆量子化にフォールバックする。
開発者への影響
MacBookでの検証が一段とやりやすくなります。これまで「llama.cppで動かす用」と「Transformersで評価する用」は別の世界で、プロンプトの検証結果を量子化モデルに持っていくときに毎回つなぎ直しが必要でした。同じAPIで扱えるなら、その往復が消えます。
Web制作の実務で言えば、クライアントの原稿や商品データを外部APIに出したくない案件——医療系、士業、社内資料を含む会社案内など——で、手元のMacだけで下書き生成や分類を回す選択肢が現実的になります。2.74GBのQ4_K_Mなら16GBメモリのMacでも余裕があり、開発機をそのまま検証環境にできます。
利用条件
現時点ではApple Silicon+MPSが前提で、WindowsやLinuxのGPU環境では恩恵が限定されます。対話的な単発利用に最適化されているため、大量データの一括処理用途には向きません。
