随着远程办公的日益普及以及企业数字化转型的推进,常规流程的自动化(包括会议和研讨会录音的处理)变得愈发重要。现代视频会议系统虽然提供了自动转录功能,但这些功能通常局限于付费订阅计划,需要互联网连接,且无法提供足够的保密性。因此,开发一种本地部署、经济实惠且安全的语音转录解决方案变得极为重要。本文介绍了一种专为项目公司内部会议录音转录而设计的自动系统。该开发系统的一个显著特点是集成了开源神经网络模型:Whisper(用于语音识别)、pyannote.audio(用于话者分离——说话人识别)以及开源 GPT 模型(用于后处理和文本格式化)。该系统采用结合了 Python 和 C# 两种编程语言的混合架构实现,兼具高性能音频处理与用户友好的图形界面。该解决方案的主要优势包括完全自主运行(无需云连接)、支持俄语、可扩展性以及符合信息安全要求。在对照音频片段上的测试显示,其词错误率(WER)和字符错误率(CER)指标均达到了商务应用可接受的水平。为了评估所设计系统的准确性,还在各种声学环境中进行了额外测试,结果表明该系统在典型操作条件以及存在背景噪声的情况下均能保证良好的转录质量。该实施的软件产品将使企业能够节省视频会议系统付费使用权限和企业订阅的费用,同时提高记录会议和研讨会的透明度与效率。这项工作对于企业自动化领域国内 IT 解决方案的发展具有理论和实践意义。
Polozov et al. (Sat,) 研究了这一问题。