Chorus v1
ストックにはログインが必要です
重なる話者を同時に文字起こし
Artificial Intelligence
Audio
Meetings
概要
Chorus v1は、重なる発話を同時に文字起こしできる単一モデルです。従来は1人の話者として文字起こしを行い、話者識別とディアリゼーションで分離する二段階アプローチが一般的でしたが、Chorus v1は最初の話者用トークンと次の話者用トークンを別々に学習させ、重なる発話にも対応します。
- オープンウェイトのモデルとしてHuggingFaceで公開
- Trelis Router経由で利用可能
- 会議・対話の文字起こしに有用
- 今後は複数話者やリアルタイム処理の拡張が期待されます。
投票数: 8