Соврал, не последнее. Вот мнение соавтора (и достаточно уважаемого исследователя, у него есть другие клёвые работы) вышеупомянутого бенчмарка SWE Bench Verified , который делался совместно с OpenAI. Он говорит примерно то же, что я написал выше — OpenAI имели доступ к решениям и задачам многих бенчмарков, но их не ловили на том, что они читерят и как-то нечестно используют эти данные.