Самая недооценённая работа этого года про text-to-SQL В январе на CIDR вышла статья с названием, которое не оставляет пространства для интерпретаций: «Text-to-SQL Benchmarks are Broken». Четверо исследователей из UIUC вручную перепроверили эталонные ответы в двух самых цитируемых бенчмарках. РАХМЕТ им большой за это Результат: • BIRD Mini-Dev, 498 примеров — ошибки разметки в 52.8% задач. Предыдущая работа находила 36.1%, то есть нашли ещё 102 сломанных примера • Spider 2.0-Snow — из 121 задачи с опубликованными эталонами проблемными оказались 80. Это 66.1% Порядок в лидерборде частично определялся тем, чьи ошибки удачнее совпали с ошибками разметки Речь именно про эталоны. Про те самые правильные ответы, с которыми сравнивают модель Что конкретно сломано • Эталон вызывает `ST_POINT(26.75, 51.5)`, а Snowflake ждёт порядок «долгота, широта». Координаты перепутаны в самом эталоне • Вопрос про учеников с 1 по 12 класс, эталон берёт колонку `Enrollment (K-12)` — а она включает подготовительный. Эталон отвечает не на заданный вопрос • `TO_TIMESTAMP(end_date)` даёт начало последнего дня вместо конца. Эталон молча теряет все события после полуночи • После JOIN и FLATTEN строки размножились, `DISTINCT` не поставили — эталон считает дубликаты • Семь вопросов с неоднозначным форматом вывода: оставил кавычки — ответ признан неверным Последнее особенно показательно. Агент отвечает правильно и получает ноль за форматирование А дальше самое интересное Авторы взяли пять топовых агентов с лидерборда BIRD и прогнали их на исправленной выборке из 100 задач Точность поехала на от −3% до 31% в относительном выражении, рейтинг перетасовался на три позиции. Агент CHESS стоял четвёртым — поднялся с 62% до 81% и стал первым. OpenSearch-SQL стоял первым — опустился с 71% до 69% и стал третьим То есть порядок в лидерборде частично определялся тем, чьи ошибки удачнее совпали с ошибками разметки Две оговорки, без них нечестно Команда Spider 2.0 обновила формулировки вопросов в июле 2025 и часть неоднозначностей сняла, а аудит делали по более раннему срезу. И 66.1% — это доля среди 121 проверенной задачи из 547, а не по всему датасету Но вывод не меняется Когда вам показывают девяносто с чем-то процентов на публичном text-to-SQL бенчмарке, в этой цифре есть вклад ошибок разметки. И ни вы, ни автор цифры не знаете, какой именно Поэтому единственная осмысленная метрика для вашей компании — внутренний eval на ваших схемах, ваших определениях метрик и реальных вопросах бизнеса. Чужой лидерборд на этот вопрос не отвечает А вы свои цифры точности на чём меряете?
Самая недооценённая работа этого года про text-to-SQL В январе на CIDR вышла…
147 viewsОткрыть в Telegram →
Из этого канала
- #1001Практический вывод из этого прямой. Публичный лидерборд не отвечает на вопрос,…
Практический вывод из этого прямой. Публичный лидерборд не отвечает на вопрос, насколько хорошо агент будет работать в вашей компании: он измеряет чужую…
- #999Современный Процесс разработки ПО поменялся. Цитата из свежей статьи от…
Современный Процесс разработки ПО поменялся. Цитата из свежей статьи от Антропик: Build is no longer the constraint — the human-speed steps around it are.
- #998⚡️ Всего 10 дней до Agentic Football Cup в Алматы! Регистрация на AI-турнир…
⚡️ Всего 10 дней до Agentic Football Cup в Алматы! Регистрация на AI-турнир выходит на финишную прямую.
- #997ARCH CAMP: Burabay Marina Club (Yacht Club). Закрываем летний сезон на берегу…
ARCH CAMP: Burabay Marina Club (Yacht Club). Закрываем летний сезон на берегу озера Щучье! 📅 29–30 августа 2026 Сбор на месте 29 августа в 15:00, выезд в…