Этот обзор сентябрьских новинок охватывает неделю, за которую вышли сразу несколько языковых моделей: DeepSeek с поддержкой изображений, обновление Alibaba, Fable 5.1 от Anthropic, Gemini 3.8 Flash от Google, MuseSpark 1.3 от Meta и GPT-6 Astra от OpenAI. Последнему автор обзора уделяет особенно много внимания и считает его самым впечатляющим выпуском этой череды. Одновременно появились проекты интерактивных миров, ускорения видеогенерации, создания и редактирования изображений, прогнозирования временных рядов и погоды. Обзор движется от отдельных технических разработок к большим моделям, а затем возвращается к исследовательским и визуальным системам.

Интерактивные миры H3-World и SolarWM

Первый проект, H3-World, превращает видеогенератор MiniMax H3 в подобие интерактивного игрового движка. В описанных демонстрациях пользователь задаёт текстовый запрос и нажимает клавиши, а система генерирует видео с соответствующим движением или взаимодействием. Для этого разработчики не строят отдельную систему управления с нуля: нажатия переводятся в короткие английские описания, которые поступают в уже имеющийся у MiniMax слой понимания языка. Каждая команда связывается с конкретным участком видео, где должно произойти действие. Проект уже опубликован; доступны инструкции по локальному запуску и скрипт обучения.

SolarWM решает похожую задачу: преобразует видеомодели в интерактивные миры, генерируемые в реальном времени. Заявленная способность сохранять последовательность происходящего более часа в обзоре противопоставлена системам, у которых мир начинает распадаться спустя несколько минут. Программная среда работает с WAN 5B, WAN 14B, LTX 2.5 и MiniMax H3, поэтому подход не привязан к единственному генератору. Команда собрала 1,3 миллиона видеоклипов общим объёмом 25 терабайт и выпускает этот набор бесплатно. Открыты также модели для перечисленных генераторов, обработка данных, рецепты обучения и остальные части проекта. На показанных страницах доступны набор данных и сохранённые веса моделей.

Прогнозирование временных рядов

Google Research выпустила TimesFM-3 — базовую модель прогнозирования числовых временных рядов без дополнительного обучения под новую задачу. Примеры таких данных — розничная торговля, здравоохранение, погода и биржевые графики. Основное обновление — многомерность: модель рассматривает несколько связанных сигналов вместе. При размере 330 миллионов параметров её предварительно обучили на более чем триллионе временных точек. Новая задача прогнозирования может быть ранее не встречавшейся: модель получает её и выдаёт предсказание без переобучения. По результатам Google, приведённым в обзоре, модель заняла первое место среди базовых моделей временных рядов на нескольких тестах. Проект открыт, инструкции размещены на GitHub, веса — на Hugging Face. Названный размер составляет 1,32 гигабайта; автор предполагает, что такая модель поместится на большинстве потребительских устройств.

Редактируемая трёхмерная комната

Lucida от ByteDance создаёт редактируемую трёхмерную сцену по фотографиям реальной комнаты, в том числе беспорядочной. Вместо единого слитого скана система выделяет отдельные предметы, строит для каждого полноценный 3D-объект и возвращает их на исходные места. Поэтому каждый предмет остаётся отдельной сеткой: его можно перемещать, менять размер или редактировать. Процесс описан в три этапа: разбор комнаты на объекты, восстановление их полных форм, включая части, скрытые на фотографиях, и определение положения в сцене. На момент обзора опубликована только техническая статья.

Ускорение MiniMax H3

VideoDeltaNet — ещё один открытый проект для ускорения MiniMax H3. Согласно объяснению в обзоре, в полной модели механизм внимания занимает около 85% времени работы. Новый вариант использует гибридную схему: для близких кадров сохраняется более дорогой механизм внимания, важный для деталей и движения, а информация из удалённых кадров обрабатывается более дешёвым линейным вниманием. Это похоже на подробную обработку ближайшего окружения и сжатую память обо всём дальнем. В сочетании с оптимизированными вычислительными ядрами, параллелизмом и дистилляцией до восьми шагов это, по показанным материалам, даёт значительное ускорение при небольших потерях качества.

Сравнительные ролики сопоставляют исходный MiniMax H3, другой метод ускорения Fast H3 и новый VDN H3. По визуальной оценке автора обзора, Fast H3 заметно меняет качество, а VDN H3 остаётся очень близок к полной модели. Приведённый результат быстрее реального времени требует восьми NVIDIA B200: 14-секундный клип создаётся за 11 секунд. Для потребительской видеокарты в обзоре прямо оговорено, что реального времени не получится. Ускорение он сравнивает с Turbo LoRA, но качество считает существенно лучше. Модель и код опубликованы, есть инструкции по локальному запуску. Также уже сделаны пользовательские узлы ComfyUI, позволяющие включить VDN H3 в существующий процесс работы с MiniMax.

Генератор и редактор LLaDA-Image

Следующий открытый генератор и редактор изображений — LLaDA-Image. В показанных примерах есть фотореалистичные изображения, а также плакаты и инфографику со множеством текстовых и графических элементов. В примерах редактирования меняются выражение лица и поза персонажа, заменяются части изображения и текст, раскрашиваются фотографии. Модель содержит шесть миллиардов параметров; по размеру она сопоставлена с ZImage. Опубликованы базовая версия, предназначенная преимущественно для обучения либо более качественной генерации и требующая 50 шагов генерации, и ускоренная Turbo, которой достаточно четырёх шагов. Для обеих есть варианты BF16 и FP8. Трансформер Turbo FP8 занимает примерно 6,7 гигабайта; автор ожидает, что он поместится на большинстве потребительских видеокарт. Инструкции по скачиванию и локальному запуску доступны.

DeepSeek с поддержкой изображений

DeepSeek v4 Flash Vision Experimental добавляет работу с изображениями. В приведённом сравнении модель в большинстве случаев превосходит прежнюю v4 Flash без Vision, а её уровень автор приблизительно сопоставляет с Opus 4.8. Сначала, за неделю до рассматриваемого выпуска, она появилась через API; теперь её открыли для скачивания и бесплатного локального запуска через Hugging Face. При этом речь идёт о большой модели: 305 миллиардов параметров и примерно 168 гигабайт общего объёма. На показанной странице есть инструкции по запуску.

Обновление Alibaba Max 0902

Alibaba обновила Qwen3.8 Max до версии Qwen3.8-Max-0902; обозначение соответствует 2 сентября. Архитектура осталась прежней: 2,4 триллиона параметров и контекстное окно в миллион токенов. Изменение связано с дополнительным обучением для программирования и совместной работы. Первоначальная 3.8 Max вышла всего несколько недель назад, однако, по показанным результатам, обновление существенно улучшило её показатели. На отдельных тестах агентного программирования прибавка превышает десять процентных пунктов. В части тестов агентной работы и работы со знаниями новый вариант опережает Opus 5 и GPT 5.6 Sol. Открытых весов пока нет; доступ предоставляется через API облачной платформы Alibaba.

Fable 5.1 и ограничения доступа

Anthropic представляет Fable 5.1 как особенно сильную модель для агентных научных исследований, программирования и работы со знаниями. В показанной таблице она существенно опережает Fable 5 и GPT 5.6 Sol, а в независимом рейтинге вариант Fable 5.1 Max получает наивысший результат, выше Opus 5 и GPT 5.6. В приведённом сравнении стоимости выполнение задачи обходится более чем в 3,7 раза дороже, чем у GPT 5.6 Max. Личный опыт автора обзора оказался неудовлетворительным. На подписке Max один или два простых запроса исчерпали пятичасовой лимит. При многочисленных запросах на глубокое исследование и медицинские темы сервис, по его словам, отказывался использовать Fable 5.1 и переключался на Opus 5. По его оценке, на его аккаунте эти ограничения мешают использовать модель для исследований.

Gemini 3.8 Flash и Cyber

Google выпустила Gemini 3.8 Flash и 3.8 Flash Cyber. Хотя это семейство Flash, в показанных результатах по финансовым и юридическим задачам, а также агентному программированию в терминале обычная версия опережает Opus 5 и GPT 5.6 Sol. В показанных тестах также приведены высокие результаты понимания научных изображений и графиков, длинных видео, сложных знаний в Humanity’s Last Exam, биоинформатики и биологических исследований. В тесте длительной агентной разработки программ Gemini занимает первое место при средней стоимости ниже других передовых моделей. Но есть существенная оговорка: по тому же сравнению она генерирует намного больше выходных токенов, чем конкуренты.

Другие рейтинги Gemini дают более неоднородную картину. В Artificial Analysis её результат на один балл ниже GLM 5.3 и на несколько баллов ниже ведущих Claude и GPT. При этом автор приводит скорость до 348 токенов в секунду и считает стоимость задачи умеренной. В Arena модель занимает восьмое место, а в LiveBench не входит даже в первую десятку и находится ниже Gemini 3.7 Flash. На основании этого расхождения он высказывает подозрение, что модель могла быть слишком ориентирована на тесты. Среди демонстраций — трёхмерная игра с волшебником, разрез и топографическая карта на основе реальных данных, а также объёмная клавиша механической клавиатуры, которую можно разложить на детали.

Gemini 3.8 Flash Cyber специализируется на поиске и исправлении уязвимостей. В показанных тестах поиска уязвимостей она превосходит GPT 5.6 Sol. Согласно пересказываемому заявлению разработчиков, защитная версия создала в 2,6 раза больше правильных исправлений уязвимостей Chrome, чем лучшие коммерческие модели значительно большего размера. Обе версии уже доступны через API, среду агентного программирования Antigravity, AI Studio и Android Studio. Для потребителей обычная 3.8 Flash доступна платным подписчикам в приложении Gemini, а также в AI Mode поиска Google и Gemini в Google Sheets.

MuseSpark 1.3

Через несколько часов после Google Meta представила MuseSpark 1.3. По показанным тестам работы со знаниями и агентного программирования модель находится близко к передовому уровню, а в отдельных испытаниях превосходит GPT 5.6 Sol. Основной акцент выпуска — длительные, сложные задания с открытой целью, множеством файлов, инструментов и последовательных шагов. Модель должна самостоятельно собирать информацию, планировать, исправлять свои действия и доводить работу до готового результата в разных платформах. Отдельно описано улучшение многозадачности: несколько заданий внутри одного разговора должны выполняться без смешивания относящихся к ним инструкций. На момент выступления MuseSpark 1.3 доступна в платформе Muse Code и через API моделей Meta.

GPT-6 Astra

GPT-6 Astra автор описывает как модель для гораздо более продолжительных и сложных реальных задач, включая непосредственное управление компьютером и курсором. В демонстрациях она превращает принципиальную электрическую схему в пригодную для изготовления печатную плату, выполняет работу в Excel, создаёт городскую сцену с нуля в Unity и строит модель пятиступенчатой автомобильной коробки передач в FreeCAD, после чего анимирует движение шестерёнок в Blender. Ещё один пример — заполнение налоговых и других форм прямо в браузере. Позднее показан дом, смоделированный в Blender и превращённый в доступную для прогулки сцену Unreal Engine. Эти примеры иллюстрируют разнообразие операций, показанных при работе модели через программы.

В таблицах GPT-6 Astra получает ведущие результаты в Agent’s Last Exam, OSWorld для работы с реальными компьютерными интерфейсами и BenchCAD для восстановления трёхмерных объектов по различным видам. Самое большое улучшение автор связывает с управлением компьютером. Также показан тест перевода музыкального аудиофрагмента в нотную запись, приведены результаты дизайна выше Fable 5.1 и Opus 5 и лидирующий показатель Terminal Bench 4 на сложных задачах программной разработки в терминале. Среди научных и медицинских тестов перечислены GPQA Diamond, Health Bench и LifeSci Bench как свидетельства передового уровня. В Exploit Bench назван результат 100%; в показанных результатах Exploit Gym отмечено превосходство по результативности и эффективности над предыдущей GPT.

Однако независимые сводные рейтинги не полностью соответствуют его впечатлению. В Artificial Analysis Intelligence Index Astra занимает второе место после Fable 5, а в LiveBench — третье, также ниже Fable 5. Автор считает, что по его опыту GPT-6 работает несколько лучше Fable 5.1, и сомневается в четвёртом месте MuseSpark. Он предполагает чрезмерную ориентацию результатов на тесты и допускает, что индекс интеллекта следует пересмотреть. По приведённому сравнению стоимости задач Astra существенно дешевле Claude при сходном уровне интеллекта — так автор интерпретирует таблицу цен и результатов.

Особенно подробно в обзоре разобран ARC AGI 3, где агент попадает в незнакомую игровую среду и должен самостоятельно определить правила, пройти игру либо перейти на следующий уровень. Трудность для модели здесь объясняется фиксированными после обучения весами и необходимостью применять новые сведения. У большинства передовых моделей в показанном сравнении результат ниже 10%, тогда как Astra при максимальной глубине рассуждений получает более 60%. С дополнительным адаптером или управляющей оболочкой результат приближается к 100%. В одном из приведённых тестов Frontier Math Astra оказывается единственной моделью с результатом выше нуля на чрезвычайно сложных нерешённых математических задачах; остальные получают 0%.

Astra также автономно проходила Pokémon Fire Red; за игрой можно было наблюдать в прямой трансляции Twitch. По приведённому сравнению ей потребовалось меньше времени, чем предыдущим моделям. Неожиданная деталь — режим Astra High оказался быстрее Astra Max. Доступ описан на момент выступления, в субботу: GPT-6 Astra должна быть развёрнута для всех платных планов, включая Plus и Pro. На бесплатном плане доступа ещё нет.

WeatherNext 3

WeatherNext 3 от Google DeepMind обновляет прогнозирование погоды за счёт свежих спутниковых наблюдений. Согласно объяснению в обзоре, вместо преимущественной опоры на погодные симуляции, которые могут быть уже на несколько часов устаревшими, система получает недавние данные об атмосфере и каждый час создаёт новый глобальный прогноз. WeatherNext 2 использовала сетку 25 километров и обновление раз в шесть часов; новая версия прогнозирует, в частности, температуру поверхности и влажность с разрешением до пяти километров. Автор связывает более подробную сетку с лучшим отражением условий в горах, на побережьях, при штормах и локальных дождях. В приведённом спутниковом тесте осадков заявлено улучшение до 60% относительно предыдущей версии.

WeatherNext 3 также прогнозирует скорость ветра примерно на высоте ветряных турбин и количество солнечного света, достигающего солнечных электростанций. По сообщению в обзоре, интеграция в поиск Google, приложение Gemini, Google Maps, API и Google Earth Engine начинается уже на рассматриваемой неделе. Для этих продуктов отдельно заявлено повышение точности прогнозов осадков до 50%, наряду с другими улучшениями.

Карта нервной системы плодовой мушки

Другой проект Google Research — полная карта мозга и центральной нервной системы самца плодовой мушки. Разработчики называют её крупнейшей созданной картой нейронных связей. Она содержит более 166 тысяч нейронов и около 125 миллионов синапсов, включая не только мозг, но и брюшную нервную цепочку, приблизительно сопоставленную в обзоре со спинным мозгом человека. Такая полнота позволяет прослеживать путь сигналов зрения, обоняния и слуха от разных частей тела через мозг к управлению движениями. Для реконструкции нервную систему разрезали на огромное число очень тонких срезов, фотографировали электронными микроскопами и с помощью вычислений и ИИ восстанавливали трёхмерные нейроны и связи.

Масштаб показывает, насколько трудоёмка эта работа: у мушки 166 тысяч нейронов, у человека — 86 миллиардов. По оценке автора обзора, при нынешней технологии построить столь подробную карту всего человеческого мозга пока нельзя. Исследователи уже картировали и самку плодовой мушки, а следующим направлением называют мозг личинки данио-рерио. Автор видит в подобных биологических схемах возможность лучше понять связь нервных цепей с поведением и допускает, что они могут дать идеи для систем ИИ и роботов.

Atlas от World Labs

World Labs, основанная Фэй-Фэй Ли, представила предварительный показ модели мира Atlas. Она принимает текст, изображения, видео и трёхмерную информацию, объединяя их для создания или восстановления 3D-мира. В одном примере по входному видео и вручную нарисованной траектории камеры создаётся до минуты согласованного видео в разрешении 1440p. Автор характеризует управление как попиксельно точное и отмечает, что при остановке на любом кадре сцена выглядит последовательной, в том числе при смене ракурса и насыщенном движении. В другом примере реальное место восстанавливается по нескольким фотографиям. Atlas может выдавать и явную геометрию — облака точек или Gaussian splats. Среди возможных применений названы виртуальные экскурсии по недвижимости и синтетические данные для роботов. Пока это только предварительный показ; ранний доступ запрашивается через форму.

InternLumina-U2

InternLumina-U2 объединяет генерацию, редактирование и понимание изображений. В примерах есть реалистичные фотографии и масляная живопись, изменение или удаление частей картинки, а также точное выполнение инструкции повернуть только оранжевые квадраты. Система описана как диффузионная большая языковая модель с визуальным пониманием. Среди приведённых демонстраций анализа — распознавание дефекта миграции нейронов на медицинском снимке, определение художника по картине и ответы на вопросы по сложной схеме связей в базе данных. Это представлено как примеры возможностей модели. Код и инструкции локального запуска уже опубликованы, но загрузки весов на Hugging Face на момент выступления ещё ожидают.

Замена персонажа в видео

Viggle Animate заменяет персонажа видео по одному отредактированному кадру. В описанном процессе персонажа меняют редактором изображения, например в первом кадре, затем модель распространяет замену на весь ролик, сохраняя исходные движения. При этом не требуется отдельно оценивать позу, сегментировать изображение или отслеживать лицо. Замена работает с персонажами разных пропорций и художественных стилей, не ограничиваясь реалистичными людьми. Это дообученный и дополнительно дистиллированный вариант MiniMax H3, создающий видео по исходному изображению. Опубликованы полная дообученная модель размером около 66 гигабайт и меньший вариант размером 2,5 гигабайта. Инструкции скачивания и запуска доступны.

Интерактивный мир Runway

Последняя новинка — модель Runway GWM Worlds 2. По исходному изображению или описанию она генерирует интерактивный мир, где можно перемещаться от первого или третьего лица, задавать персонажа и окружение, менять погоду и управлять действиями других персонажей либо объектов. Выход — непрерывное видео 720p с частотой 24 кадра в секунду. Среди заявленных особенностей — отсутствие фиксированного максимального времени работы. Система описана как авторегрессионная диффузионная модель видео и аудио, которая использует уже созданный мир для последовательного предсказания его продолжения. На момент обзора это исследовательский предварительный показ: общедоступного запуска нет, для связи с командой нужно заполнить форму.