
research note
SEC-bench Pro — Can Language Models Solve Long-Horizon Software Security Tasks?
SEC-bench Pro addresses gaps in evaluating large language models (LLMs) for automated software security tasks by providing a benchmark designed for real-world, long-horizon bug hunting on complex, …










