В стане концептуальных моделей (самая известная, наверное, была LCM) пополнения, скейлим модели и делаем их более end-to-end. Хороший результат, практически вдвое более быстрое обучение по сравнению с LLM бейзлайном (OLMo). NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction __Jiaqi Cao, Chiyu Chen, Shuang Cheng, Xu Cheng, Beiya Dai, Yufan Feng, Kewen Ge, Ruijun Ge, Jiayi Huang, Yang Jiao, Dahua Lin, Zhouhan Lin, Yifan Liu, Yuliang Liu, Biqing Qi, Mowen Ruan, Junzhe Shen, Yunchong Song, Hao Sun, Zhongbo Tian, Yixuan Wang, Rubin Wei, Jiaxin Xiong, Kangyu Yang, Qian Yao, Qi Zhang, Bowen Zhou (The Intern-NCP Team)__ Paper: https://arxiv.org/abs/2609.10715 Review: https://arxiviq.substack.com/p/ncp-archpreview-technical-report Code: https://github.com/InternLM/lmdeploy, https://github.com/LUMIA-Group/ncp_olmo_eval Model: https://huggingface.co/collections/ArchSpace-Collection/ncp-archpreview ЧТО сделали: Авторы представили NCP-ArchPreview — модель с латентным пространством на 8.94B параметров, предобученную на 5.73T токенов датасета Dolma-3. Архитектура модифицирует стандартный авторегрессионный процесс: между 16-слойным энкодером токенов и 16-слойным декодером токенов внедрён промежуточный 8-слойный модуль концептов (Concept Module). Вместо оптимизации исключительно под предсказание следующего токена, система объединяет скрытые состояния токенов в спаны, квантует их в дискретный кодбук с помощью Product Quantization и обучает модель end-to-end параллельно предсказывать будущие концепты и генерировать токены, связывая уровни динамическими иерархическими residual connections. ПОЧЕМУ это важно: Классические авторегрессионные языковые модели страдают от «близорукости» локальной оптимизации: семантическое планирование на уровне фраз возникает лишь как побочный эффект минимизации пословной кросс-энтропии. Превращая дискретные латентные репрезентации в полноценные таргеты обучения, NCP-ArchPreview достигает финального лосса бейзлайна OLMo-3-7B, расходуя лишь 51.3% вычислительных ресурсов (ускорение сходимости в 1.95× и выигрыш по Парето-эффективности вычислений в 1.74×). Кроме того, дискретное пространство концептов открывает возможность эффективного файнтюнинга через интерфейс кодбука размером всего 17M параметров и повышает долю принятых токенов в speculative decoding за счёт явной контекстной траектории. Для практиков: Современные LLM генерируют текст слово за словом — примерно как человек, который начинает говорить, совершенно не продумав фразу заранее. Такой прямолинейный подход требует триллионов токенов, чтобы сеть выучила абстрактные идеи и логические структуры. В этой работе модель учат параллельно планировать высокоуровневые концепты на несколько слов вперёд и выводить токены последовательно. В результате сеть обучается почти в два раза быстрее, увереннее справляется с математикой и задачами на рассуждение, а также получает модульный словарь идей, который можно адаптировать под специализированные домены без риска забывания базовых знаний или использовать для ускорения генерации практически без оверхеда по памяти. Обучать концепты тут: https://t.me/gonzo_ML_podcasts/4802
В стане концептуальных моделей (самая известная, наверное, была LCM)…
Из этого канала
- #5995Прикольный заход на оптимизацию KV-кешей, когда модель сама может подсветить,…
Прикольный заход на оптимизацию KV-кешей, когда модель сама может подсветить, куда собирается смотреть, пометить это тегами, а на инференсе vLLM быстро…
- #5992Передавая когнитивные функции ллмкам, полезно представлять, как вы их заберёте…
Передавая когнитивные функции ллмкам, полезно представлять, как вы их заберёте обратно, если понадобится.
- #5989В твиттере новая мания - нейросети по схеме мозга настоящей мухи. За последние…
В твиттере новая мания - нейросети по схеме мозга настоящей мухи. За последние несколько дней я видел десяток демо, где мозг настоящей мухи заставляют играть в…