Los modelos de lenguaje grande (LLMs) han mostrado un gran potencial para la generación automática de código en el desarrollo de software, sin embargo, su efectividad en la programación de sistemas embebidos—que requiere comprensión de lógica de software y limitaciones de hardware—no ha sido bien estudiada. Los marcos de evaluación existentes no cubren de manera integral escenarios prácticos de desarrollo de microcontroladores en proyectos del mundo real de Internet de las Cosas (IoT). Este estudio evalúa de manera sistemática 27 LLMs de última generación a través de ocho escenarios de sistemas embebidos de creciente complejidad, desde la lectura básica de sensores hasta la integración completa de bases de datos en la nube con tableros de visualización. Usando microcontroladores ESP32 con sensores ambientales y de movimiento, empleamos el Proceso de Jerarquía Analítica con cuatro criterios ponderados: funcionalidad, instrucciones, salida y creatividad, evaluados de forma independiente por dos revisores expertos. Los modelos con mejor rendimiento fueron Claude Sonnet 4.5, Claude Opus 4.1, y Gemini 2.5 Pro, con puntajes de 0.984 a 0.910. El rendimiento se degradó con la complejidad: 19-23 modelos generaron código compilable para aplicaciones simples, pero solo 3-5 produjeron soluciones funcionales para escenarios complejos que involucraban Grafana y bases de datos en la nube. La falla más frecuente fue la alucinación de bibliotecas inexistentes o un uso incorrecto de la API, siendo la capacidad funcional la principal barrera y la calidad de seguimiento de instrucciones el diferenciador clave entre los modelos competentes. Estos hallazgos proporcionan una guía empírica para los desarrolladores embebidos sobre la selección de LLM y señalan las limitaciones del impulso cero para el desarrollo de IoT dependiente de hardware.
Babiuch et al. (Wed,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: