Квены потренили Qwen 3.5 4B для автопилота, только добавили к нему голову в которую 3D данные со сцены заходят (BEV Perception Head) + добавлен planning expert это 32 слоя диффузионного трансформера который генерит траекторию движения (50 точек на 5 секунд) из шума (noisy trajectory на картинке) + представлений из vlm ну и учили в 4 этапа все эти части Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving https://arxiv.org/abs/2609.00111 https://www.alphaxiv.org/ru/abs/2609.00111 https://github.com/QwenLM/Qwen-Drive-1.0 PS статьи собираем и проекты делаем в https://t.me/researchim