O rápido crescimento da indústria automobilística intensificou a demanda por modelos precisos de previsão de preços no mercado de carros usados. Os compradores frequentemente têm dificuldade em determinar o valor de mercado justo devido à complexidade de fatores como quilometragem, marca, modelo, tipo de transmissão, histórico de acidentes e condição geral. Este estudo apresenta uma análise comparativa de modelos de aprendizado de máquina para previsão de preços de carros usados, com forte ênfase no impacto da engenharia de características. Começamos avaliando vários modelos — incluindo Regressão Linear, Árvores de Decisão, Floresta Aleatória, Regressão de Vetores de Suporte (SVR), XGBoost, Regressor de Empilhamento e redes neurais baseadas em Keras — em dados brutos e não processados. Em seguida, aplicamos um pipeline abrangente de engenharia de características que inclui codificação categórica, remoção de outliers, padronização de dados e extração de características ocultas (por exemplo, idade do veículo, potência). Os resultados demonstram que o pré-processamento avançado melhora significativamente o desempenho preditivo em todos os modelos. Por exemplo, o escore R² do Regressor de Empilhamento aumentou de 0,14 para 0,8899 após a engenharia de características. Métodos de conjunto, como CatBoost e XGBoost, também mostraram ganhos significativos. Esta pesquisa não apenas compara modelos para essa tarefa, mas também serve como um tutorial prático ilustrando como características engenheiradas melhoram o desempenho em pipelines de ML estruturadas para outros pesquisadores. O fluxo de trabalho proposto oferece um modelo reproduzível para a construção de ferramentas de precificação de alta precisão no domínio automotivo, promovendo transparência e tomada de decisões informadas.
Fayyaz et al. (Terça-feira,) estudaram esta questão.