Chorus v1 logo

Chorus v1

重なる話者を同時に文字起こし

Artificial Intelligence Audio Meetings

概要

Chorus v1は、重なる発話を同時に文字起こしできる単一モデルです。従来は1人の話者として文字起こしを行い、話者識別とディアリゼーションで分離する二段階アプローチが一般的でしたが、Chorus v1は最初の話者用トークンと次の話者用トークンを別々に学習させ、重なる発話にも対応します。

  • オープンウェイトのモデルとしてHuggingFaceで公開
  • Trelis Router経由で利用可能
  • 会議・対話の文字起こしに有用
  • 今後は複数話者やリアルタイム処理の拡張が期待されます。
投票数: 8
← 投稿一覧に戻る