Authors
Loading...
Benchmark evaluates task success rates of large language models in no-code development, highlighting challenges.
Deng et al. (2025) studied this question.