Key points are not available for this paper at this time.
Avanços recentes em classificação linear mostraram que, para aplicações como classificação de documentos, o processo de treinamento pode ser extremamente eficiente. No entanto, a maioria dos métodos de treinamento existentes são projetados assumindo que os dados podem ser armazenados na memória do computador. Esses métodos não podem ser facilmente aplicados a dados maiores que a capacidade da memória devido ao acesso aleatório ao disco. Propomos e analisamos uma estrutura de minimização em blocos para dados maiores que o tamanho da memória. A cada passo, um bloco de dados é carregado do disco e tratado por certos métodos de aprendizado. Investigamos duas implementações da estrutura proposta para SVMs primal e dual, respectivamente. Como os dados não podem caber na memória, muitas considerações de design são muito diferentes das usadas para algoritmos tradicionais. Discutimos e comparamos com abordagens existentes que são capazes de lidar com dados maiores que a memória. Experimentos utilizando conjuntos de dados 20 vezes maiores que a memória demonstram a eficácia do método proposto.
Yu et al. (Tue,) estudaram essa questão.