OrcaRouter、100万トークン対応の「DeepSeek-V4.1-Flash」提供開始
日本DeepSeekOrcaRouterAPI料金
FlashLabsが運営するOrcaRouterで、DeepSeekの新モデル「DeepSeek-V4.1-Flash」の提供が始まった。最大100万トークンの入力と38.4万トークンの出力に対応し、非ピーク時は入力100万トークンあたり0.15ドル。OpenAI互換APIのため、エンドポイントもリクエスト形式も変えずに利用できる。
何が発表されたか
- FlashLabs株式会社が運営する OrcaRouter で、DeepSeek の新モデル「DeepSeek-V4.1-Flash」の提供が始まった(米国時間2026年9月10日リリース、国内告知は9月11日)。
- OrcaRouter を通せば、OpenAI互換のAPI一本で利用できる。エンドポイントもリクエスト形式も変更不要。従来は分かれていた提供形態が1つに統合された。
- モデルの主な仕様。
- 入力は最大100万トークン、1応答あたり最大38.4万トークンの出力に対応。
- 入力はテキストと画像、出力はテキストのみ。
- ツール呼び出し、構造化出力、推論モードに対応。
- 非対称アーキテクチャ(総パラメータ552B)により計算量を削減。KVキャッシュの所要はメモリで従来比1/4、ストレージで1/8。
- 料金(非ピーク時)は入力100万トークンあたり 0.15ドル、出力 0.60ドル、キャッシュ済み入力 0.003ドル。ピーク時間帯(UTC平日01:00〜04:00および06:00〜10:00)は倍額。
開発者への影響
- 単価が桁違いに安い。出力0.60ドル/100万トークンは、フロンティア級モデルの1/10前後の水準。分類、抽出、要約、下書き生成といった「量で効く」処理をここに逃がすだけで、月次のAPI費用は目に見えて下がる。
- 100万トークンの入力枠は、大規模なコードベースの読み込みや、長い議事録・仕様書一式の一括処理に向く。キャッシュ済み入力が0.003ドルなので、同じ長文コンテキストを繰り返し使う設計にすればさらに安くなる。
- ピーク/非ピークで単価が倍変わる点は要注意。UTC の該当時間帯は日本時間の午前10時〜13時と15時〜19時にあたり、日本の業務時間帯がまるごとピークに重なる。バッチ処理は夜間に寄せると効果が大きい。
- OpenAI互換なので、既存コードの検証コストは低い。品質が要る処理は既存モデル、量が要る処理はこちら、という二段構えが組みやすい。
