适用于声纹把同一个人拆成了两组。合并后两组的发言都归到目标组名下。
这句里其实有两个人。拖动滑块选切点,右半会自动变成新的一段等你标人。
① 认人模式:左边是待认的声纹组。点一个(或直接按 Enter 跳姓名框), 页面会把同一个声音在不同录音里的片段自动串起来连播。听出来就在姓名框打字 → Enter 保存并自动跳下一组。
② 校对模式:选一份录音,逐句过一遍。点句子播放,右边点编号(或按数字键)改说话人。 改了的地方会记在 overrides 里,导出时一并带走。
overrides
空格 播放/暂停 R 重播本段 ←→ 上/下一段 Enter 跳到姓名框 / 保存并下一组 S 跳过 X 标记分不出 1–9 校对模式快速选编号 ↑↓ 上/下一句 L 单段循环(听不清时反复听这一句) Ctrl+Z 撤销 Ctrl+Shift+Z 重做 Ctrl+F 查找 Tab 采纳声纹库给的建议名 Ctrl+E 导出(多种格式) Ctrl+S 快速导出 voices.json
导出… 支持 TXT / SRT / VTT / CSV / RTTM / Markdown / voices.json, 可选单份录音或全部。 RTTM 是声学界的通用交换格式(pyannote、diarize、Kaldi、NeMo 都读写它), 导出给别人能直接用;导入 RTTM 则可以把别人的结果拿来做对照。 ⇄ 对照(校对模式):显示原生 MOSS 的说话人编号;黄色句表示「它被我们分到了别处」。 📊 对照分析 给出两套结果的交叉统计。
所有改动实时存在浏览器本地(localStorage)。点「导出」下载 voices.json 才算落盘。 ⚠️ 直接双击本文件打开时(file://)无法自动写盘;用 启动.bat 起本地服务后即可自动保存。
启动.bat