Vercel AI Gateway、MicrosoftのMAI音声・文字起こし3モデルを追加
VercelAI GatewayMicrosoftTTS音声認識
Vercel AI GatewayでMicrosoftのMAI-Voice-2.1、同Flash、MAI-Transcribe-2 Streamingが利用可能になった。23言語の音声生成と、音声受信中に部分文字起こしを返すストリーミング認識に対応する。Gateway側の手数料・上乗せはなく、各モデルの提示レートで課金される。
何が発表されたか
- Vercel AI Gateway に Microsoft の音声系3モデルが追加(2026年10月1日)。
microsoft/mai-voice-2.1— 23言語の表現力ある音声生成。長文でも話者の一貫性を保ち、ナレーションやオーディオブック向け。microsoft/mai-voice-2.1-flash— 低レイテンシ版。音声エージェントや対話用途。microsoft/mai-transcribe-2-streaming— 音声が届いている最中に部分文字起こしを返すストリーミング認識。リアルタイム字幕に使える。
- 課金は各モデルの提示レートのまま。Gateway のプラットフォーム手数料・推論への上乗せはなし。
開発者への影響
9月下旬にはGemini 3.8のTTS 2モデルが同じGatewayに入っており、音声まわりの選択肢が短期間で厚くなった。テキスト生成・TTS・文字起こしを1つのGateway課金にまとめられるので、案件単位の原価を1枚の請求で把握できるのは受託では地味に効く。
実務で効きそうなのは文字起こしのストリーミング対応だ。打ち合わせ録画の字幕付与や、問い合わせ電話の要約といった用途で「全部録り終わってから投げる」設計が要らなくなる。ただし音声は単価の体感が掴みにくいので、1案件あたりの実額を小さく測ってから見積に載せること。
補足
具体的な単価は発表に記載がなく、Gateway のモデル一覧側で確認する必要がある。
