核心能力

面试听题

视频面试场景:识别扬声器(或麦克风)中的问题,完整定稿后自动流式作答;可切换提词器文档辅助口述。

扬声器识别问题后,AI 流式口述回答
  • 可配置听题音源:仅扬声器 / 仅麦克风 / 双通道(实时 ASR 正式场景建议单路,避免限流)。
  • 语音识别支持:本地 sherpa-onnx(默认推荐 Zipformer)、通义 Fun-ASR Realtime、智谱 GLM Realtime。
  • 对话区展示多轮问答,可重试某一轮;迷你模式支持列表视图。
  • 提词器:可导入 txt / md / pdf / docx,文档保存在本机磁盘,重开客户端仍保留。看稿时可配合「眼神矫正」出镜。
  • 建议先在「面试准备」导入简历与 JD,并按需开启知识库检索。

高级配置(会议页折叠面板)

「听题 ASR」只选模型与 Key;真正影响「何时切段 / 何时自动解答」的参数在会议页「高级配置」里。折叠标题旁会显示当前定稿秒数,方便一眼确认。

  • 文本纠错:远程 ASR 默认关闭;本地实时强制用大模型补标点与专名。追求速度可关,追求准确可开。
  • 定稿静音(客户端):连续无语音多久才认为「整题说完」并自动解答(0~2s)。
  • 服务端定稿静音(仅云端实时):厂商 VAD 多久无声才交出一句识别结果;与客户端定稿相互独立。
  • 本地 Silero:断句静音(0.1~1s,默认 0.3s)、检测阈值、最短/最长语音 —— 只影响切段,不直接触发解答。