TADA logo

TADA

テキストと音声を1対1で整合させ、音声生成を5倍速化

Artificial Intelligence Open Source Audio

概要

TADA は Hume AI のオープンソースの音声言語モデル。テキストと音声を1対1で同期させるデュアルアライメントにより、テキストトークンと音響フレームの大きなミスマッチを解消。高速生成(従来比約5倍)により語句の欠落や内容の幻覚を抑え、1000件以上のテストで幻覚ゼロを報告。約700秒の音声を 2,048 トークンのコンテキスト内に格納可能。1B English と 3B multilingual のモデルをオープンソースライセンスで公開し、エッジデバイス上の信頼性の高い音声エージェント構築を後押しします。

なぜ注目か

  • テキストと音声の同期という根本的な改革
  • 速度と長い文脈の両立
  • 低幻覚・高信頼性の TTS ソリューションの新しい選択肢
  • コミュニティ利用の可能性が広がるオープンソース提供
投票数: 123
← 投稿一覧に戻る