Key points are not available for this paper at this time.
O modelo contínuo Skip-gram, recentemente introduzido, é um método eficiente para aprender representações vetoriais distribuídas de alta qualidade que capturam um grande número de relações sintáticas e semânticas precisas entre palavras. Neste artigo, apresentamos várias extensões que melhoram tanto a qualidade dos vetores quanto a velocidade de treinamento. Ao realizar subsamplings das palavras frequentes, obtemos um aumento significativo de velocidade e também aprendemos representações de palavras mais regulares. Também descrevemos uma alternativa simples ao softmax hierárquico chamada amostragem negativa. Uma limitação inerente às representações de palavras é sua indiferença à ordem das palavras e sua incapacidade de representar frases idiomáticas. Por exemplo, os significados de "Canadá" e "Ar" não podem ser facilmente combinados para obter "Ar Canadá". Motivados por este exemplo, apresentamos um método simples para encontrar frases em texto e mostramos que é possível aprender boas representações vetoriais para milhões de frases.
Mikolov et al. (Quarta-feira,) estudaram essa questão.