В работе с таблицами, кажется, случается свой Jev-moment — вышла новая маленькая и быстрая фундаментальная табличная модель, которая бьёт всех на zero-shot, одновременно работая с классификацией и регрессией. Почему обычные LLM плохи на таблицах мы обсуждали здесь. TabPFN-3.5: Technical Report __Prior Labs Team (Benjamin Jäger, Nick Erickson, Léo Grinsztajn, Felix Birkel, Klemens Flöge, Lennart Purucker, Arthur Cahu, Vahid Balazadeh, Jonas Kübler, Alan Arazi, Philipp Jund, Siyuan Guo, Anurag Garg, Jan Hendrik Metzen, Mihir Manium, Jake Robertson, David Salinas, Andrej Tschalzev, Simon Bing, Adrian Hayler, Tobias Schröder, Oscar Key, Brendan Roof, Georg Grab, Simone Alessi, Dominik Safaric, Eliott Kalfon, Philipp Singer, Clara Cornu, Diana Kriuchkova, Lilly Wehrhahn, Tuana Çelik, Vitor Monteiro, Rylee Grace, Adèle Frankel, Kürşat Kaya, Kristina Collins, Lydia Sidhoum, Marie Salmon, Tomás Pereda, Jerry Chen, Madelon Hulsebos, Yann LeCun, Bernhard Schölkopf, Frank Hutter, Sauraj Gambhir, Noah Hollmann)__ Paper: https://arxiv.org/abs/2609.17895 Review: https://arxiviq.substack.com/p/tabpfn-35-technical-report Code: https://github.com/PriorLabs/TabPFN Model: https://huggingface.co/Prior-Labs/tabpfn_3_5 ЧТО сделали: Представили TabPFN-3.5 — базовую модель для табличных данных, работающую без подбора весов под конкретный датасет. Авторы расширили скрытую размерность трансформера до 1024, объединили классификацию и регрессию в одной сети и заменили внешний препроцессинг обучаемыми признаками Фурье и ранжированием по эмпирическому распределению. ЧТО получили: TabPFN-3.5 заняла первое место на семи табличных бенчмарках со средним винрейтом 78% против конкурирующих табличных базовых моделей и 89% против классических алгоритмов. На TabArena модель набрала 1866 Elo (а TabPFN-3.5-Thinking — 1910 Elo) против 1780 у TabFM и 1631 у TabPFN-3. На TALENT средний ранг составил 2.95 на 274 датасетах против 5.35 у TabICLv2 и 4.48 у TabPFN-3. ПОЧЕМУ это важно: Инженеры получают zero-shot инференс быстрее секунды на сложных таблицах со строками и групповыми сплитами без подбора гиперпараметров. При этом нативная мультимодальность и максимальная скорость инференса остаются закрытыми enterprise-решениями. Зирошотить таблицы здесь: https://t.me/gonzo_ML_podcasts/4817
В работе с таблицами, кажется, случается свой Jev-moment — вышла новая…
Из этого канала
- #6072Недавно писал про прикольный подход Recirculation, а тут уже и его развитие…
Недавно писал про прикольный подход Recirculation, а тут уже и его развитие подоспело (от конкурирующей команды) Write Back the Δ: Revisiting the Same Tokens…
- #6075По свежим запросам читателей. Это какая-то интересная статья — получается, что…
По свежим запросам читателей. Это какая-то интересная статья — получается, что достаточно двух случайно инициализированных голов внимания, в правильном порядке…
- #6065Команда из DeepMind продолжает поиски сознания. From cacophony to hierarchy: a…
Команда из DeepMind продолжает поиски сознания. From cacophony to hierarchy: a principled framework for assessing AI consciousness Shamil Chandaria, Arvo Muñoz…
- #6062Экспонента в статьях, экспонента в коде, что ещё? Какой прекрасный толк :)…
Экспонента в статьях, экспонента в коде, что ещё? Какой прекрасный толк :) https://youtu.be/vDjWdRyKXY?is=opUGqNWz7C7CngDp
- #6060Нормальный скачок за три месяца. Слава AI!
Нормальный скачок за три месяца. Слава AI!