Key points are not available for this paper at this time.
我们展示的结果表明,可以构建一个具有竞争力、极大简化的大词汇量连续语音识别系统,使用完整单词作为声学单位。我们通过深度双向LSTM RNN和CTC损失直接建模约100,000个单词的输出词汇。该模型在125,000小时的半监督声学训练数据上进行训练,使我们能够缓解单词模型的数据稀疏问题。我们证明了CTC单词模型作为端到端的全神经语音识别模型运行良好,无需使用传统的依赖上下文的子词音节单元,而这些单元通常需要发音词典,并且无需任何语言模型,从而免去了解码的需要。我们展示了CTC单词模型的性能优于一个强大、更复杂的最先进基线,该基线使用子词单元。
Soltau等人(星期三)研究了这个问题。