Самая недооценённая работа этого года про text-to-SQL В январе на CIDR вышла статья с названием, которое не оставляет пространства для интерпретаций: «Text-to-SQL Benchmarks are Broken». Четверо исследователей из UIUC вручную перепроверили эталонные ответы в двух самых цитируемых бенчмарках. РАХМЕТ им большой за это Результат: • BIRD Mini-Dev, 498 примеров — ошибки разметки в 52.8% задач. Предыдущая работа находила 36.1%, то есть нашли ещё 102 сломанных примера • Spider 2.0-Snow — из 121 задачи с опубликованными эталонами проблемными оказались 80. Это 66.1% Порядок в лидерборде частично определялся тем, чьи ошибки удачнее совпали с ошибками разметки Речь именно про эталоны. Про те самые правильные ответы, с которыми сравнивают модель Что конкретно сломано • Эталон вызывает `ST_POINT(26.75, 51.5)`, а Snowflake ждёт порядок «долгота, широта». Координаты перепутаны в самом эталоне • Вопрос про учеников с 1 по 12 класс, эталон берёт колонку `Enrollment (K-12)` — а она включает подготовительный. Эталон отвечает не на заданный вопрос • `TO_TIMESTAMP(end_date)` даёт начало последнего дня вместо конца. Эталон молча теряет все события после полуночи • После JOIN и FLATTEN строки размножились, `DISTINCT` не поставили — эталон считает дубликаты • Семь вопросов с неоднозначным форматом вывода: оставил кавычки — ответ признан неверным Последнее особенно показательно. Агент отвечает правильно и получает ноль за форматирование А дальше самое интересное Авторы взяли пять топовых агентов с лидерборда BIRD и прогнали их на исправленной выборке из 100 задач Точность поехала на от −3% до 31% в относительном выражении, рейтинг перетасовался на три позиции. Агент CHESS стоял четвёртым — поднялся с 62% до 81% и стал первым. OpenSearch-SQL стоял первым — опустился с 71% до 69% и стал третьим То есть порядок в лидерборде частично определялся тем, чьи ошибки удачнее совпали с ошибками разметки Две оговорки, без них нечестно Команда Spider 2.0 обновила формулировки вопросов в июле 2025 и часть неоднозначностей сняла, а аудит делали по более раннему срезу. И 66.1% — это доля среди 121 проверенной задачи из 547, а не по всему датасету Но вывод не меняется Когда вам показывают девяносто с чем-то процентов на публичном text-to-SQL бенчмарке, в этой цифре есть вклад ошибок разметки. И ни вы, ни автор цифры не знаете, какой именно Поэтому единственная осмысленная метрика для вашей компании — внутренний eval на ваших схемах, ваших определениях метрик и реальных вопросах бизнеса. Чужой лидерборд на этот вопрос не отвечает А вы свои цифры точности на чём меряете?