1. Home
  2. News
  3. 音声AIのSarvam AI、インドの22言語と英語を1つのモデルで扱うSaaras V4を公開
2026/09/25

Startup Portfolio

音声AIのSarvam AI、インドの22言語と英語を1つのモデルで扱うSaaras V4を公開

Sarvam AIは、音声認識モデルの最新世代であるSaaras V4を公開しました。インドの言語と英語にまたがる多言語の音声を、雑音や方言、言語の混在といった実環境の条件のもとで扱うことに重点を置いています。同社によれば、インド憲法第8附則に定める22言語のすべてで最高水準の性能を達成し、英語についてもインド英語だけでなく世界各地の発音へ対応を広げました。

構成は、音声エンコーダと、同社が一から学習させた30億パラメータのハイブリッド状態空間モデルによるデコーダの組み合わせです。同じ音声から5つの出力形式を選べる点が特徴で、発話をそのまま書き起こす逐語、数字や句読点を整える正規化、インド言語の文中で英単語を英字のまま残すコードミックス、ラテン文字への翻字、英語への翻訳が用意されています。これにより、音声認識、翻字、翻訳をそれぞれ別の仕組みとして組み合わせる必要が減ります。評価では、単語誤り率(WER)に加え、表記の揺れが意味の違いを伴うかを言語モデルに判定させるLLM-WERも併用しており、IndicContextEvalベンチマークではキーワードを与える設定でWER16.03%と報告しています。

低遅延の逐次処理にも対応し、同社は最初のトークンまでの時間が150ミリ秒未満だとしています。英語の性能とインド言語の対応範囲を二者択一にする必要がなくなり、1つの音声認識モデルで多言語の音声アプリケーションを作れるようになると説明しています。想定用途には顧客対応、音声インターフェース、会議の記録などが挙がります。なお、同社のAPI文書では、現時点で既定かつ推奨のモデルは引き続きSaaras V3とされ、V4は22のインド言語の対応範囲を保ったまま英語の対応を広げた最新版として位置づけられています。ここで示された数値はいずれも同社の公表値で、第三者による検証は示されていません。


Sarvam AIについて
Sarvam AIとは、2023年に設立されたインドの人工知能企業で、本社はカルナータカ州ベンガルールにあります。Vivek RaghavanとPratyush Kumarが共同創業しました。インドの多様な言語を前提に、大規模言語モデル、音声認識のSaaras系列、音声合成、翻訳などを自社で開発し、開発者向けのAPIとして提供しています。インド政府のIndiaAI Missionのもとで国産の基盤モデル開発を担う企業の一つに選ばれており、低資源言語を含むインドの言語でAIを使えるようにすることを目指しています。

 

TagsAI

関連ニュース

Contact

AT PARTNERSにご相談ください