Предрасчитанная карта науки для агентов. Каждый раз парсить статью медленно и невыгодно, удобно иметь базу. По факту company brain для работы со статьями. Может мне тоже такой собрать? Впрочем, разоришься на компьюте. Идеально, если такие карточки статей автоматом для всех статей на arxiv начнут появляться, с доступом по MCP. Lacuna: A Research Map for Machine Learning __Martin Weiss, Miles Q. Li, Alejandro H. Artiles, Yacine Mkhinini, Chris Pal, Hugo Larochelle, Nasim Rahaman__ Paper: https://arxiv.org/abs/2606.26246 Review: https://arxiviq.substack.com/p/lacuna-a-research-map-for-machine Code: N/A Model: https://lacuna.tiptreesystems.com # TL;DR ЧТО сделали: Авторы представили Lacuna — масштабную, предварительно вычисленную и структурированную карту научных исследований в области машинного обучения, охватывающую более 733 000 статей. Вместо сырых PDF-файлов Lacuna предлагает взаимосвязанную иерархическую базу данных, состоящую из суммаризаций статей, атомарных концептов, синтезированных направлений исследований и автоматически сгенерированных гипотез. Это превращает дорогостоящий и медленный разбор литературы «на лету» в быстрый обход графа, доступный через веб-интерфейс, markdown-файлы и протокол Model Context Protocol (MCP). ПОЧЕМУ это важно: Классические RAG-системы и агенты класса Deep Research вынуждены раз за разом парсить неструктурированные PDF-файлы во время инференса. Это приводит к огромным расходам токенов, задержкам и галлюцинациям. Lacuna переносит вычислительную и когнитивную нагрузку научного поиска «влево» — на этап офлайн-предобработки. В итоге затраты на инференс для агентов снижаются более чем на 75%, а точность цитирования растёт. Проект задаёт новый стандарт для инфраструктуры научных доказательств, доказывая, что предварительно вычисленные сети концептов справляются с синтезом литературы, ответами на вопросы и генерацией гипотез гораздо лучше классического динамического поиска. Для практиков: Если вы строите научных ИИ-агентов, парсинг PDF на лету — это прошлый век. Использование структурированных баз знаний и протокола MCP позволяет радикально снизить задержки и расходы на API, одновременно повышая точность ответов. Строить карту науки тут: https://t.me/gonzo_ML_podcasts/4319
Предрасчитанная карта науки для агентов. Каждый раз парсить статью медленно и…
Из этого канала
- #5685Анонсированы ICML 2026 Awards…
Анонсированы ICML 2026 Awards https://blog.icml.cc/2026/07/05/announcing-the-icml-2026-awards/ На этой неделе пройдусь по ним авторазборами.
- #5686Перед тем, как постить призёров ICML 2026, новая адаптивная джепа! AdaJEPA: An…
Перед тем, как постить призёров ICML 2026, новая адаптивная джепа! AdaJEPA: An Adaptive Latent World Model Ying Wang, Oumayma Bounou, Yann LeCun, Mengye Ren…
- #5691Пошли статьи с ICML 2026. Интересное про языковые диффузионки. Если в обучении…
Пошли статьи с ICML 2026. Интересное про языковые диффузионки. Если в обучении их ограничить последовательной генерацией, то итоговый результат лучше, чем если…
- #5675"Гиппокамп завезли! Вообще мне понравилось. Красиво и просто. К реккурентному…
"Гиппокамп завезли! Вообще мне понравилось. Красиво и просто. К реккурентному состояния Gated DeltaNet добавляем точную память токенов, вызвавших максимальное…
- #5669DeepSeek ускоряет спекулятивное декодирование за счёт параллельного драфтера…
DeepSeek ускоряет спекулятивное декодирование за счёт параллельного драфтера (как у DFlash) с элементами быстрой авторегрессионности.