增强配置 · 4 min

听题 ASR

会议听题与模拟面试都依赖语音识别。当前仅支持实时流:本地 sherpa-onnx、通义 Fun-ASR Realtime、智谱 GLM Realtime。

听题效果依赖 ASR;建议正式面试前用真实会议软件试一次

可选方案

  • 本地实时(sherpa-onnx):免 API Key。默认推荐 Zipformer 流式(低延迟);可选 SenseVoice(离线中英混说)、Paraformer 流式。首次使用会下载模型到本机目录。
  • 通义 Fun-ASR Realtime:阿里云百炼 WebSocket 实时流(云端推荐,需百炼 API Key)。
  • 智谱 GLM Realtime:智谱 WebSocket 实时会话识别(云端推荐,需智谱 API Key)。

高级配置说明

高级配置决定「切段有多勤」和「何时把整题交给 AI」。展开后分为三块:文本纠错、断句与定稿、自动解答。

  • 文本纠错:定稿后再用大模型纠正专名 / 补标点。远程 ASR 默认关闭(更快);本地实时始终开启。环境嘈杂或专名多时可手动打开远程纠错。
  • 定稿静音(客户端):连续无有效语音达到该时长,才认为问题说完并触发自动解答。调大更稳、更慢;调小更快、更容易半截提交。
  • 服务端定稿静音(仅 Fun / 智谱):云端 VAD 判定「这一句听完了」的静音阈值,影响中间听写刷新节奏,不直接等于整题提交。与客户端定稿独立配置。
  • Silero 断句静音(仅本地):0.1~1s,默认 0.3s。只负责按换气切段与补听写,不会单独触发解答。
  • Silero 检测阈值 / 最短语音 / 单句最长:控制灵敏度与过短片段丢弃、过长强制切断。环境吵可略提高阈值。
  • 完整问题后自动解答:关闭后仍可听写,需手动「立即定稿并解答」或快捷键提交。

怎么调更顺

  1. 云端正式面试:优先 Fun-ASR 或 GLM Realtime;服务端定稿约 0.5~1s,客户端定稿略大于服务端一点,减少半截题。
  2. 本地离线 / 无 Key:选 Zipformer;Silero 断句默认 0.3s 即可,说话停顿短可再略降。
  3. 听写已经准、但自动解答偏慢:优先减小「定稿静音」,不要先把服务端定稿压得过低。
  4. 听写被拆得很碎:本地略增大 Silero 断句静音;云端略增大服务端定稿静音。
  5. 实时流建议只开「扬声器」或「麦克风」一路,避免双通道并发触发厂商限流。

模拟面试注意

模拟面试的语音作答转写走本地 WAV 识别。若当前选的是 Fun / GLM 实时流,请临时改成「本地实时」再模拟;正式会议听题仍可用云端实时。