Algorithmic review evaluates optimization techniques for big data K-means clustering, demonstrating that higher algorithmic complexity does not ensure superior practical trade-offs.
Key Points
To comprehensively analyze and benchmark optimization techniques designed to overcome scalability limitations in minimum sum-of-squares clustering for big data.
Reviewed optimization approaches including decomposition, sampling, initialization, parallel and distributed computing, data summarization, and metaheuristic hybridization.
Benchmarked representative algorithms using a unified protocol assessed via the 'less is more' approach (LIMA) across clustering quality, execution speed, and simplicity.
Demonstrated a multi-algorithm Pareto front under LIMA dominance, confirming that no individual optimization technique is universally superior across all evaluation metrics.
Lightweight approaches maximized processing speed at the expense of accuracy, whereas complex hybrid frameworks achieved higher clustering accuracy at substantially elevated computational costs.
Stochastic-sampling methods consistently occupied an intermediate position, offering an effective trade-off among accuracy, execution time, and algorithmic simplicity.