Liquid AI、視覚言語モデルを最大3.13倍高速化するドラフトモデルを公開
Liquid AIVLMオープンウェイト投機的デコードエッジAI
Liquid AIが2026年9月24日、LFM2.5-VL-3B向けの投機的デコード用ドラフトモデル「LFM2.5-VL-3B-DSpark」をオープンウェイトで公開した。280Mパラメータの4層構成で、端末上で最大3.13倍、H100で2.66倍のデコード高速化を主張する。
何が発表されたか
- 2026年9月24日、Liquid AIが LFM2.5-VL-3B-DSpark を公開。投機的デコード(speculative decoding)のドラフトモデル
- ターゲットは3Bパラメータの視覚言語モデル LFM2.5-VL-3B。ドラフト側は280Mパラメータ、アテンションのみの4層構成でブロックサイズ8〜9
- 追加コストはターゲットモデル比で約8.9%
- 主張される高速化:
- オンデバイス: デコード2.30〜3.13倍、エンドツーエンド1.56〜2.62倍
- H100 GPU: デコード2.66倍、エンドツーエンド1.64〜2.27倍
- 出力品質を変えずに推論を速くする方式。VQA、画像キャプション、マルチターン対話などに対応
- オープンウェイトで配布され、ダウンロード・ファインチューン・デプロイに制限なし
- 初日から llama.cpp、MLX-VLM、SGLang が対応
実務への影響
画像を読ませるAI機能をサイトやアプリに載せる場合、ネックになるのはAPI課金とレスポンス時間。3Bクラスのオープンウェイトをローカルやエッジで動かす選択肢は以前からあったが、体感速度が実用ラインに届かないケースが多かった。デコードで2〜3倍というのは、その線を越えうる差になる。
具体的な用途としては、EC商品画像からの属性抽出・自動タグ付け、入稿画像のNGチェック(ロゴや文字の写り込み判定)、スキャン書類の読み取りといった「大量だが1件あたりの難易度は低い」処理。ここを外部APIから自前ホストに移せれば、ランニングコストの構造が変わる。
llama.cppとMLXが初日対応なので、Mac上での検証も含めて試すハードルは低い。
