Microsoftが話しながら文字にする新モデル「MAI-Transcribe-2-Streaming」を公開。日本語を含む60言語、約0.1秒で文字が出始める
・Microsoftが、話している最中から文字起こしを返す新しいAIモデル「MAI-Transcribe-2-Streaming」を公開した。日本語を含む60言語に対応し、話す言語も自動で見分ける
・音声を受け取ってから0.1秒あまりで最初の文字を返す。外部の評価サイトで、確定した文字・途中の文字の両方の正確さで1位になったとしている
・あわせて、多言語で同じ声のまま話せる音声合成「MAI-Voice-2.1」と高速版も公開。いずれも開発者向けで、ふだんのアプリからすぐ使えるものではない
Microsoftは2026年10月1日、話している最中に文字起こしを返すAIモデル「MAI-Transcribe-2-Streaming(ストリーミング)」を公開しました。
これまでのAIの文字起こしの多くは、話し終わってから、または録音を渡してから文字にする方式でした。新しいモデルは、話している途中から文字が出始め、話が進むにつれて直していきます。
この記事では、公式の発表で分かったことを整理したうえで、ふだんの仕事がどう変わるのかを考えます。
話し終わるのを待たずに文字が出る。最初の文字は0.1秒あまり
まずは、文字起こしの新モデルを見ていきます。
Microsoftの発表によると、MAI-Transcribe-2-Streamingの特徴は次のとおりです。
・60言語で、リアルタイムに文字起こしをする
・話している言語を、途中で切り替わっても自動で見分け続ける
・音声を受け取ってから0.1秒あまりで、最初の仮の文字を返す。話が進むと内容を直し、すぐに確定させる
・字幕づけやリアルタイムの口述筆記では、Microsoftの社内評価で、最も近い競合より2倍速く文字が現れた
日本語への対応は、Microsoftの技術資料にある、もとになったモデル「MAI-Transcribe-2」の対応言語一覧で確認できます。
正確さについては、AIの性能を比べる外部サイト「Artificial Analysis」で、確定した文字と途中の文字の両方で1位になったと書かれています。
同じ声のまま多言語で話す音声合成も。声の複製には悪用を防ぐ仕組み
同じ日に、文字を読み上げる音声合成の新モデルも2つ公開されました。
| モデル | 特徴 | 料金(100万文字あたり) |
|---|---|---|
| MAI-Voice-2.1 | 23言語・26地域に対応。1つの声で、言語を切り替えてもその土地の発音で話せる | 22ドル |
| MAI-Voice-2.1-Flash | 同じ言語に対応し、速さと安さを重視。45秒分の音声を約0.15秒の遅れで作り始める | 15ドル |
どちらも、数秒の見本の音声から声を複製でき、同意のない悪用を防ぐ仕組みが組み込まれていると説明されています。
23言語の中に日本語が含まれるかどうかは、発表文に記載がありません。
スポンサーリンク
使えるのは開発者向けの窓口から。文字起こしは年末まで特別価格
ここで、どこで使えるのかを整理します。
3つのモデルはいずれも、自社のアプリやサービスに組み込む開発者向けに提供されています。
・Microsoft Foundry(Microsoftの開発者向けAIサービス)
・MAI Playground(試せる場所)
・Vercel、Azure Voice Live など。LiveKitは近日対応
文字起こしの料金は、年末までの特別価格で、音声1時間あたり0.54ドルです。
WordやTeamsなど、ふだん使うMicrosoftの製品にいつ入るかは、発表文に書かれていません。
仕事はどう変わるか:「会議が終わってから議事録」が「会議中に字幕と要点」に変わる
ここからは、公式の情報をもとにした僕の見方です。
このモデルで変わるのは、話した言葉が文字になる「タイミング」だと考えています。
これまでは、会議を録音して、終わってから文字起こしと要約をする流れが一般的でした。話している最中から正確に文字が出るなら、会議中に字幕が流れ、その場で要点や決まったことをAIがまとめる、といった使い方が現実的になります。
電話の問い合わせ窓口のように、相手が話し終わる前にAIが内容をつかんで準備を始める使い方も、発表文で例に挙がっています。
外国語の取引先と話す場面にも効きます。話す言語を自動で見分け続けるので、日本語の会議も英語の会議も、言語を設定し直さずに同じ仕組みで文字にできます。
オンラインで打ち合わせが多い個人事業主にとっても、議事録づくりの手間が大きく減りそうです。
使う前に、確かめておきたいこともあります。
・今は開発者向けの提供で、ふだんのアプリから直接は使えない
・WordやTeamsなどに入る時期は書かれていない
・会議の音声を外部のサービスに送ることになるので、会社で使うなら情報の扱いのルールを先に確かめる必要がある
いま会議ツールの文字起こし機能を使っている人は、そのツールが今後こうした新しいモデルに切り替わるかを、ときどき確かめておくとよいでしょう。
まとめ:MAI-Transcribe-2-Streamingは話しながら文字にするモデル。会議の「その場で記録」が近づく
MAI-Transcribe-2-Streamingは、日本語を含む60言語で、話している最中から文字起こしを返すMicrosoftの新しいモデルです。同じ声で多言語を話せる音声合成も、あわせて公開されました。
議事録が「会議の後の作業」から「会議中にできあがるもの」に変わっていくのが、いちばん大きな変化です。
今は開発者向けなので、ふだん使う会議ツールに入ってくるのを待ちながら、社内の情報の扱いのルールを整えておくのがよさそうです。
出典
・Microsoft AI「Our first streaming transcription model debuts at no. 1 on Artificial Analysis」(2026年10月1日) https://microsoft.ai/news/our-first-streaming-transcription-model/
・Microsoft Learn「MAI-Transcribe-2 – Speech Service」(対応言語) https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe
