01

什么是 SenseVoiceSmall 本地识别

SunGet 使用 sherpa-onnx 运行 SenseVoiceSmall INT8。模型在 CPU 本地执行,不需要额外安装 Python 或 PyTorch;按需下载版第一次使用模型时需要联网,下载完成后可以在本机处理视频语音。

02

本地识别与云识别的区别

本地识别的音频处理在设备上完成,适合重视本地数据边界或希望减少按量 API 调用的场景;云识别取决于已配置服务、网络和额度。两种结果都需要根据录音质量人工检查,不能把模型输出当作百分之百准确的逐字稿。

03

从视频生成文稿

  1. 1

    检查 FFmpeg 和 SenseVoice 模型状态。

  2. 2

    在当前视频库选择一个本地视频。

  3. 3

    启动本地语音识别,等待音频提取与模型处理完成。

  4. 4

    打开语音文稿和同名 SRT,检查人名、专有名词、数字与断句。

04

长视频与准确率

长视频处理时间取决于视频时长、CPU 性能和音频质量。清楚的人声、较少的背景音乐和稳定音量通常更有利;多人重叠说话、方言、噪声和专业术语会增加校对工作。