AI
PR

Microsoftが話しながら文字にする新モデル「MAI-Transcribe-2-Streaming」を公開。日本語を含む60言語、約0.1秒で文字が出始める

キラ
記事内に商品プロモーションを含む場合があります

・Microsoftが、話している最中から文字起こしを返す新しいAIモデル「MAI-Transcribe-2-Streaming」を公開した。日本語を含む60言語に対応し、話す言語も自動で見分ける

・音声を受け取ってから0.1秒あまりで最初の文字を返す。外部の評価サイトで、確定した文字・途中の文字の両方の正確さで1位になったとしている

・あわせて、多言語で同じ声のまま話せる音声合成「MAI-Voice-2.1」と高速版も公開。いずれも開発者向けで、ふだんのアプリからすぐ使えるものではない

Microsoftは2026年10月1日、話している最中に文字起こしを返すAIモデル「MAI-Transcribe-2-Streaming(ストリーミング)」を公開しました。

これまでのAIの文字起こしの多くは、話し終わってから、または録音を渡してから文字にする方式でした。新しいモデルは、話している途中から文字が出始め、話が進むにつれて直していきます。

この記事では、公式の発表で分かったことを整理したうえで、ふだんの仕事がどう変わるのかを考えます。

話し終わるのを待たずに文字が出る。最初の文字は0.1秒あまり

まずは、文字起こしの新モデルを見ていきます。

Microsoftの発表によると、MAI-Transcribe-2-Streamingの特徴は次のとおりです。

・60言語で、リアルタイムに文字起こしをする

・話している言語を、途中で切り替わっても自動で見分け続ける

・音声を受け取ってから0.1秒あまりで、最初の仮の文字を返す。話が進むと内容を直し、すぐに確定させる

・字幕づけやリアルタイムの口述筆記では、Microsoftの社内評価で、最も近い競合より2倍速く文字が現れた

日本語への対応は、Microsoftの技術資料にある、もとになったモデル「MAI-Transcribe-2」の対応言語一覧で確認できます。

正確さについては、AIの性能を比べる外部サイト「Artificial Analysis」で、確定した文字と途中の文字の両方で1位になったと書かれています。

同じ声のまま多言語で話す音声合成も。声の複製には悪用を防ぐ仕組み

同じ日に、文字を読み上げる音声合成の新モデルも2つ公開されました。

モデル特徴料金(100万文字あたり)
MAI-Voice-2.123言語・26地域に対応。1つの声で、言語を切り替えてもその土地の発音で話せる22ドル
MAI-Voice-2.1-Flash同じ言語に対応し、速さと安さを重視。45秒分の音声を約0.15秒の遅れで作り始める15ドル

どちらも、数秒の見本の音声から声を複製でき、同意のない悪用を防ぐ仕組みが組み込まれていると説明されています。

23言語の中に日本語が含まれるかどうかは、発表文に記載がありません。

スポンサーリンク

使えるのは開発者向けの窓口から。文字起こしは年末まで特別価格

ここで、どこで使えるのかを整理します。

3つのモデルはいずれも、自社のアプリやサービスに組み込む開発者向けに提供されています。

・Microsoft Foundry(Microsoftの開発者向けAIサービス)

・MAI Playground(試せる場所)

・Vercel、Azure Voice Live など。LiveKitは近日対応

文字起こしの料金は、年末までの特別価格で、音声1時間あたり0.54ドルです。

WordやTeamsなど、ふだん使うMicrosoftの製品にいつ入るかは、発表文に書かれていません。

仕事はどう変わるか:「会議が終わってから議事録」が「会議中に字幕と要点」に変わる

ここからは、公式の情報をもとにした僕の見方です。

このモデルで変わるのは、話した言葉が文字になる「タイミング」だと考えています。

これまでは、会議を録音して、終わってから文字起こしと要約をする流れが一般的でした。話している最中から正確に文字が出るなら、会議中に字幕が流れ、その場で要点や決まったことをAIがまとめる、といった使い方が現実的になります。

電話の問い合わせ窓口のように、相手が話し終わる前にAIが内容をつかんで準備を始める使い方も、発表文で例に挙がっています。

外国語の取引先と話す場面にも効きます。話す言語を自動で見分け続けるので、日本語の会議も英語の会議も、言語を設定し直さずに同じ仕組みで文字にできます。

オンラインで打ち合わせが多い個人事業主にとっても、議事録づくりの手間が大きく減りそうです。

使う前に、確かめておきたいこともあります。

・今は開発者向けの提供で、ふだんのアプリから直接は使えない

・WordやTeamsなどに入る時期は書かれていない

・会議の音声を外部のサービスに送ることになるので、会社で使うなら情報の扱いのルールを先に確かめる必要がある

いま会議ツールの文字起こし機能を使っている人は、そのツールが今後こうした新しいモデルに切り替わるかを、ときどき確かめておくとよいでしょう。

まとめ:MAI-Transcribe-2-Streamingは話しながら文字にするモデル。会議の「その場で記録」が近づく

MAI-Transcribe-2-Streamingは、日本語を含む60言語で、話している最中から文字起こしを返すMicrosoftの新しいモデルです。同じ声で多言語を話せる音声合成も、あわせて公開されました。

議事録が「会議の後の作業」から「会議中にできあがるもの」に変わっていくのが、いちばん大きな変化です。

今は開発者向けなので、ふだん使う会議ツールに入ってくるのを待ちながら、社内の情報の扱いのルールを整えておくのがよさそうです。

出典

・Microsoft AI「Our first streaming transcription model debuts at no. 1 on Artificial Analysis」(2026年10月1日) https://microsoft.ai/news/our-first-streaming-transcription-model/

・Microsoft Learn「MAI-Transcribe-2 – Speech Service」(対応言語) https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-transcribe

ABOUT ME
キラ
キラ
ブログ「Spesial Life」を運営しているキラと申します。 当ブログでは、たった一度の人生を豊かに彩るための情報を発信しています。 目まぐるしく変化する現代社会の中で、思うような人生を送ることができずに困っていることはありませんか? 僕自身、大学卒業後、サラリーマンとして生きていくなかで、想像していた人生とはかけ離れた不満だらけの日々を送っていました。 それがある本と出会い、考え方と行動を変えることで、自分が望むような人生が手に入ることを知ったんです。 それ以来、自分自身の考え方と行動を変えることを実践して、人生を素晴らしいものへと変えている真っ最中です。 このブログでは僕自身の実体験を踏まえた人生を変える情報や考え方を発信しています。 あなたにとって素晴らしい人生が手に入るよう、一緒に行動していきましょう!
記事URLをコピーしました