GMAsia
    🇮🇳印度·初創企業·2026年9月25日·來源: Analytics And Insight

    Sarvam AI Saaras V4:多語言語音模型如何為印度多元語言而建構

    印度初創公司 Sarvam AI 發布了 Saaras V4,這是一個專為印度多元語言設計的多語言語音模型。該模型使用一個從零開始訓練的 30 億參數解碼器,以處理混合語音和地區口音。Sarvam 報告稱,該模型在所有 22 種支援的印度語言中均表現出最先進的性能,並在七個公共基準測試中,英語的平均錯誤率最低。

    Nexa 摘要

    Saaras V4 的價值在於其直接針對印度語音模式進行訓練。大多數 ASR 工具都是先調整為英語構建的模型。Sarvam 選擇從零開始訓練其 30 億參數解碼器,使其擁有完全的控制權。這種方法在印度 22 種官方語言中提供了更好的性能。

    關鍵詞提示功能是直接針對企業客戶的策略。開發人員可以提供多達 50 個特定詞彙。這提高了品牌名稱和技術術語的識別準確性。這直接解決了印度呼叫中心和支援平台的一個痛點。

    Sarvam AI 的真正考驗是市場採用度,而不僅限於早期採用者。其首個輸出標記的 150 毫秒響應時間支援實時串流。這種速度對於語音助理和實時字幕工具至關重要。問題是企業是否會從已建立的 ASR 供應商轉用。

    #sarvam ai app#sarvam ai founder#artificial intelligence#artificial intelligence news
    延伸閱讀
    原文報道: Analytics And Insight我們不轉載全文, 閱讀原文 →

    相關文章

    6 則