Любопытный результат про работу LLM с табличными данными, где LLM довольно хреновы и сильно уступают классике ML. Предположительные источники проблем в виде перекрытия классов, проблем парсинга CSV, токенизации чисел и размера батча оказались неважными. Зато размерность данных очень важна, из-за неё все проблемы. Вроде как на подходе новые фундаментальные табличные модели, та же свежая гугловая TabFM. С другой стороны, я не уверен, что будущее всё же за прямой работой LLM/FM с таблицами. Оно конечно удобно с точки зрения универсальности, но там где важен реальный перформанс нужны специалисты. Сгенерить специализированную RF/GDBM может быть быстрее и эффективнее, уж с генерацией такого кода LLM-то справится. Why Large Language Models Fail at Tabular Prediction __Marta Garnelo, Wojciech M. Czarnecki__ Paper: https://arxiv.org/abs/2608.02412v1 Review: https://arxiviq.substack.com/p/why-large-language-models-fail-at Code: N/A Model: N/A # TL;DR ЧТО сделали: Авторы проверили пять популярных гипотез о причинах провала больших языковых моделей (LLM) на задачах классификации табличных данных в режиме чистого инференса. Используя жёсткую проверку на заучивание данных из предобучения (memorisation probe), контролируемые манипуляции с признаками и проекции случайными матрицами, исследователи опровергли четыре традиционных объяснения — перекрытие классов, текстовый CSV-формат, токенизацию чисел и число тестовых запросов за раз. Единственной реальной причиной деградации качества моделей вроде `claude-opus-4-6` оказалась высокая размерность признакового пространства. ПОЧЕМУ это важно: Работа даёт первое причинно-следственное объяснение тому, почему универсальные языковые модели до сих пор проигрывают классическому ML на таблицах. Способности LLM катастрофически деградируют с ростом числа колонок — даже если объём полезной информации в них остаётся неизменным. Это устанавливает чёткие архитектурные ограничения для табличного ризонинга, доказывает бесполезность банального промпт-инжиниринга и подтверждает необходимость специализированных табличных фундаментных моделей. Для практиков: Разработчики часто замечают, что топовые LLM уступают алгоритмам полувековой давности на простых числовых таблицах. Вместо того чтобы обвешивать модель сложными агентскими пайплайнами и промптами, авторы протестировали «голую» модель. Выяснилось, что проблемы вовсе не в «неудобном» форматировании CSV, специфической токенизации чисел или зашумлённых границах классов. LLM отлично работают как локальные классификаторы на основе расстояний в 2D-пространстве, но их работа рушится, как только размерность признаков выходит за рамки нескольких измерений. Попытки починить это промптингом бесполезны — нужны специализированные архитектуры. Работать с таблицами тут: https://t.me/gonzo_ML_podcasts/4788
Любопытный результат про работу LLM с табличными данными, где LLM довольно…
Из этого канала
- #5916Вот это вот особенно прекрасно: Even Claude was surprised by its own finding—it…
Вот это вот особенно прекрасно: Even Claude was surprised by its own finding—it was skeptical at first, possibly because it has learned from its training about…
- #5915К гипотезе Римана подступаются...…
К гипотезе Римана подступаются... https://www.anthropic.com/research/riemann-zeta
- #5909"Автономные ИИ-черви: от зашитых эксплоитов к динамической адаптации AI Agents…
"Автономные ИИ-черви: от зашитых эксплоитов к динамической адаптации AI Agents Enable Adaptive Computer Worms Jonas Guan, Tom Blanchard, Hanna Foerster,…