LLMs can be effective at finding counterexamples in formal verification by leveraging semantic information like natural language descriptions and trajectory data, outperforming traditional black-box optimization methods on standard benchmarks.
This paper shows how large language models can find bugs in cyber-physical systems (like autonomous vehicles or industrial controllers) by treating bug-finding as an optimization problem.