У Google DeepMind появилась база предсказаний последствий девяти миллиардов замен одной буквы в человеческой ДНК. OpenAI объявила о математическом результате, над которым одновременно работали десять тысяч агентов. А новый тест работы с настоящим кодом компаний оставил ведущие модели ниже 40% решённых задач. Обзор от 13 сентября объединяет демонстрации этих систем и сравнения их результатов. В сентябрьских новинках масштаб научных вычислений соседствует с очень конкретными действиями: изменить слово в готовой записи, перенести движения человека на робота или загрузить в память только нужные части языковой модели.

Marigold V2: глубина и устройство поверхности на обычном изображении

Marigold V2 представлен как модель, которая извлекает сведения о трёхмерной глубине и структуре из обычного изображения. На вход ей дают картинку, а на выходе получают несколько разных представлений: карту глубины, нормали поверхности, альбедо и другие карты. Нормали показывают ориентацию поверхности внутри изображения; альбедо в обзоре описано как исходный цвет.

Главное отличие новой версии в обзоре связано с работой на уровне пикселей. Показанные сравнения касаются не только общей формы объектов, но и детализации, резкости и точности карт. По оценке автора обзора, в нескольких сравнениях Marigold даёт более подробные карты с более высоким разрешением, а оценки нормалей выглядят резче и лучше соответствуют исходному изображению. В демонстрируемых тестах Marigold V2 в среднем получает лучшие оценки среди сопоставимых моделей — так эти результаты представлены в обзоре.

Код уже опубликован, а в репозитории на странице проекта есть инструкции по скачиванию и локальному запуску. В показанных режимах для изображения 1024 × 1024 требуется около 17 ГБ видеопамяти, для 2048 × 2048 — около 29 ГБ. Эти числа относятся к двум приведённым режимам обработки. Более подробная карта требует больше видеопамяти.

UniMate: движения для непохожих друг на друга скелетов

UniMate посвящена другой трёхмерной задаче — анимации персонажей с разным устройством скелета. Автор противопоставляет её моделям, которые специализируются на человеке и часто затрудняются при работе с птицами, змеями и другими необычными объектами. В демонстрации одна модель используется для цветов, Гарфилда, спутника и существа, похожего на дракона. Разнообразие примеров здесь существенно: речь идёт не только о нескольких человеческих персонажах разного роста, а о формах, которые очень мало похожи друг на друга. По оценке автора, модель хорошо справляется со всеми показанными анимациями.

Для генерации нужно передать уже подготовленную трёхмерную модель со скелетом и текстовую команду. Примеры команд — собака идёт вперёд и змея ползёт вперёд. В показанном подходе UniMate автоматически создаёт движение и не требует отдельного дообучения под каждый такой объект. По его оценке, показанные анимации делают UniMate одним из лучших вариантов для необычных персонажей и предметов. Помимо кода для локального запуска опубликован и код обучения; на этом основана характеристика проекта в обзоре как полностью открытого.

AlphaGenome Atlas: предсказания для миллиардов вариантов ДНК

Google DeepMind, по рассказу автора, выпустила AlphaGenome Atlas — большую карту человеческой ДНК, созданную с помощью ИИ. Объясняя масштаб задачи, он утверждает, что лучше всего изучены примерно 2% генома, в основном связанные с кодированием белков, а остальные 98% остаются гораздо менее понятными. Задача Atlas описана как предсказание последствий каждой возможной однобуквенной мутации. Таких вариантов насчитывается примерно девять миллиардов. Экспериментально проверить их все было бы практически невозможно: в данном случае речь идёт о предсказаниях AlphaGenome, а не о девяти миллиардах лабораторных экспериментов.

Получившийся набор данных, как сообщает автор, занимает один петабайт, содержит предсказания для более чем девяти миллиардов генетических вариантов и больше базы AlphaFold более чем в 30 раз. База используется так: исследователь ищет интересующую мутацию в готовом Atlas и получает прогноз её влияния, например на регуляцию генов или производство белков. Для такого обращения не нужно каждый раз запускать модель заново. Дополнительно представлен показатель AVI — описанная в обзоре оценка воздействия, которая помогает быстрее выделять варианты для дальнейшего изучения.

В обзоре приведены два случая использования Atlas. Согласно этому рассказу, исследователи обнаружили на 22% больше генетических ассоциаций в данных UK Biobank. Кроме того, Atlas помог поддержать решение ранее неразгаданного случая редкого заболевания. Основное изменение в обзоре описано так: огромный объём прежде трудной для интерпретации генетической информации теперь оформлен в доступную для поиска базу. Atlas открыт для доступа: на странице предлагается выбрать Explore AlphaGenome Atlas и затем искать среди более чем девяти миллиардов мутаций.

LingBot-World 2.0: управляемый мир, который генерируется непрерывно

LingBot-World 2.0 представлен как интерактивная модель мира, работающая в реальном времени. Она непрерывно создаёт виртуальную среду, а пользователь управляет перемещением и прогулкой по ней клавишами. В показанных примерах автор отмечает более высокое качество по сравнению с предыдущими открытыми моделями мира: он считает окружение более детальным, связным и имеющим более высокое разрешение. Помимо клавиатурного управления предусмотрен ввод текстовых запросов, чтобы добавлять события или эффекты. Ещё одно дополнение — агентный механизм для NPC — персонажей, которыми не управляет пользователь: в среду можно включать других персонажей, которые двигаются и по-разному ведут себя или реагируют.

Команда проекта, как передаёт автор, заявляет о непрерывной генерации интерактивных миров более часа. Для системы реального времени названы разрешение 720p и скорость до 60 кадров в секунду. В основе используется видеогенератор Alibaba. Мир создаётся отдельными порциями, благодаря чему результат можно передавать потоком в реальном времени. Предыдущая информация кешируется — так устроена описанная в обзоре своеобразная память о сцене.

Код и инструкции для скачивания и локального запуска опубликованы. Представлены две версии модели с разными приоритетами: более крупная имеет 14 миллиардов параметров и даёт более высокое качество, а версия на 1,3 миллиарда параметров работает значительно быстрее. Их различие описано именно как выбор между качеством большей модели и скоростью меньшей.

Isaac 0.5: восприятие, прогноз и действие в одной модели

Isaac 0.5 автор называет открытой базовой моделью для роботов, предназначенной для более общего понимания окружающего мира и выбора следующего действия. Перечень входов включает изображения, видео, языковые инструкции, текущее состояние робота и даже предыдущие действия. На основе этих сведений модель, согласно описанию в обзоре, может предсказывать следующее действие или отвечать на вопросы. Среди отдельно названных возможностей — поиск объектов, прогноз того, как мир может выглядеть дальше, и непосредственная генерация движений робота. Здесь понимание изображения представлено как часть более широкого набора задач.

В рассказе названы 36 миллиардов параметров. Обучающие данные собраны более чем с 35 робототехнических систем; автор связывает это с возможностью применения или переноса модели на разные типы роботов. В обзоре указан объём обучения: 100 тысяч часов робототехнического опыта и около миллиона часов общего видео. Особенность архитектурного подхода — совместное обучение пониманию видео, пространственному рассуждению, предсказанию будущих состояний и физическим действиям в одной общей основе. Замысел общего обучения объясняется так: знания, полученные при работе с видео и пространством, могут помогать роботу выбирать действия и понимать физический мир.

Модель уже открыта, и со страницы проекта можно перейти к инструкциям по скачиванию и запуску.

WorldSculpt: реконструкция с отдельными редактируемыми объектами

WorldSculpt получает несколько изображений сцены или видео и превращает их в полную трёхмерную сцену с отдельными объектами. В других показанных реконструкциях результат может выглядеть как исходное окружение, но всё в нём бывает слито вместе. Отличие WorldSculpt — в разделении объектов. В WorldSculpt каждый объект восстанавливается отдельно и одновременно правильно размещается внутри общего трёхмерного мира. Это позволяет дальше работать с ним как с самостоятельной частью сцены: передвигать, изменять размер и редактировать. Искомый результат здесь — не только похожая картинка, но и разделённое устройство самой реконструкции.

Дополнительно показан пример преобразования сцены Gaussian splats в сцену с трёхмерными сетками, описывающими форму объектов. Проект представлен как уже выпущенный: код и инструкции по скачиванию и запуску находятся в репозитории, на который ведёт кнопка Code.

FIRE3D: геометрия и материалы для сцены, готовой к симуляции

FIRE3D также восстанавливает трёхмерную сцену с раздельными объектами из обычных фотографий или видео. Вход может состоять из одного изображения, нескольких изображений либо видеозаписи. Результат описан как готовый к симуляции: каждый объект становится отдельной трёхмерной сеткой, описывающей его форму, с информацией о материале. Его можно передвинуть, дополнительно отредактировать или добавить в робототехническую симуляцию.

В обзоре приведены конкретные показатели скорости: подготовка такой сцены занимает меньше минуты, а на одной видеокарте обрабатывается параллельно до 16 объектов. Эти показатели сообщаются в описании проекта. Код уже опубликован, в репозитории есть инструкции по локальной работе. Кроме того, выпущен код обучения. Это дополнение даёт доступ не только к получению результата, но и к обучению системы.

AuK: генерация, точечное редактирование и изменение звучания речи

Аудиомодель Tencent называется AuK и сравнивается автором с Nano Banana, но для речи. Сначала показана генерация голоса по тексту: можно описать желаемый голос и указать диалог. В примере звучит реплика о человеке, который всегда обещал вернуться и держал слово, но теперь не вернулся. Автор оценивает получившийся голос как печальный и наполненный горем. Следующая функция — клонирование голоса без дополнительного обучения: достаточно загрузить несколько секунд образца и затем заставить этот голос произнести другой текст. Для сравнения последовательно воспроизводятся исходный голос и сгенерированная речь.

Дальше демонстрируется редактирование уже существующего аудио, включая добавление и удаление слов. В первом коротком фрагменте человек произносит mamba out. В запись добавляют слово never, затем проигрывают изменённую версию. В обзоре вставка оценена как соединяющаяся с остальной речью без заметного разрыва. В другом примере удаляется целое предложение, после чего проигрывается оставшийся фрагмент. И в этом случае соединение после правки оценивается в обзоре как естественное.

Более длинный пример содержит рассуждение о возрасте и переменах. В исходной версии говорящий затрагивает ответ на вопрос в свои двадцать лет, затем говорит, что изменения будут постоянными, и слышит реакцию на хороший вопрос. В редактировании между репликой о постоянстве изменений и следующей реакцией вставляется мысль о том, что самый важный урок — принимать перемены. Варианты до и после вставки проигрываются подряд; переход автор обзора оценивает как очень естественный. Этот пример показывает добавление целой фразы внутри разговора, а не только одиночного слова в коротком клипе.

Следующая группа возможностей относится к качеству и эмоциональной окраске записи. Модели дают шумный, неаккуратный клип, чтобы убрать шум или улучшить голос, затем показывают отдельное повышение разрешения и качества аудио. В обоих случаях вход и результат проигрываются последовательно. После этого одну существующую реплику о ежедневных приглашениях на светские мероприятия и о том, насколько это было приятно, сначала произносят печальным тоном, а затем сердитым. В этой демонстрации меняется эмоция уже записанной речи, при этом сохраняется основное содержание одной и той же фразы.

Показано и изменение тембра: исходный мужской голос заменяется женским, описанным как ясный и яркий. Для этого проигрывается новостная фраза о преследовании детей на станции Flinders Street и штрафе 700 долларов; это материал аудиодемонстрации, а не отдельная новость обзора. Другой клип о восточном побережье преобразуется в шёпот. В перечне дополнительных операций названы добавление и удаление смеха и дыхания. Код доступен в GitHub с инструкциями по локальному запуску, а размер модели автор оценивает примерно в 6,12 ГБ. На этой основе он предполагает совместимость с большинством обычных пользовательских видеокарт и называет инструмент одним из самых гибких редакторов речи, которые видел.

DeepSeek-V4.1-Flash: новая архитектура и неоднозначное лидерство

В обзоре от 13 сентября обновление DeepSeek-V4.1-Flash автор считает гораздо более существенным, чем подсказывает изменение номера на 0,1: по его словам, устройство модели сильно отличается от предыдущей V4. Сравнение начинается с результата 74,2 на DeepSWE 1.1. В этой интерпретации балл сделал бы Flash первой в таблице, выше GPT-6 Astra. При этом в обзоре есть важная оговорка: команда DeepSWE ещё официально не добавила модель в рейтинг и её фактического размещения нужно дождаться. Результаты CyberGym и AutomationBench названы передовыми; согласно показанному сравнению, в AutomationBench Flash превосходит GPT-6 Astra Max.

По приведённым характеристикам это смесь экспертов на 552 миллиарда параметров, но во время работы активны только примерно 8–16 миллиардов. Это можно представить как команду экспертов, из которой в конкретной задаче задействуется лишь часть. Архитектура, по его словам, новая: в ней есть отдельные компоненты энкодера (обработки входных данных) и декодера (создания ответа), тогда как большинство современных языковых моделей он описывает как состоящие только из декодера. В обзоре упомянуты и другие изменения в устройстве модели, но подробнее разобрано разделение обработки входных данных и создания ответа.

Дальнейшие сравнения дают менее однозначную картину, чем первое заявление о лидерстве. В показанной таблице LiveBench от Abacus AI новая DeepSeek стоит первой среди открытых моделей, на несколько пунктов ниже GPT-6 Astra и Claude Fable. В индексе VALS, оценивающем разные задачи интеллектуального труда, она тоже названа первой открытой моделью, чуть выше Kimi K3 и GLM 5.3. При этом в обзоре сделана оговорка: разница незначительна и эти участники фактически делят первое место. В приведённом индексе интеллектуальных способностей от Artificial Analysis DeepSeek, напротив, остаётся позади Kimi K3 и GLM 5.3.

При использовании через API названа скорость 217 выходных токенов — небольших фрагментов текста — в секунду: в приведённом сравнении это более чем втрое быстрее GLM и примерно в семь раз быстрее Kimi K3. Стоимость в обзоре описана как значительно меньшая, чем у других ведущих открытых моделей и закрытых GPT-6 и Fable, но конкретные тарифы не приведены. Модель открыта, хотя исходная загрузка занимает около 510 ГБ. Сообщество уже выпустило изменённые и квантованные варианты: самый маленький показанный GGUF Q1 занимает 106 ГБ. Для тех, у кого нет оборудования под локальный запуск, API описан как доступный путь использования. Автор обзора оценивает DeepSeek как наиболее выгодную по стоимости ведущую модель.

OpenAI и уравнения Навье — Стокса: результат с внешней силой

OpenAI объявила о результате для уравнений Навье — Стокса. Исходный вопрос в обзоре объясняется на примерах обычного движения воды и воздуха. Эти уравнения описывают движение жидкостей и газов — от воды, закручивающейся в чашке, до воздуха в комнате. Вопрос в том, существуют ли условия, при которых такое описание перестаёт работать. Автор связывает его с задачами тысячелетия и говорит примерно о 90 годах без решения. По его изложению, OpenAI использовала внутреннюю модель, которую сама компания считает значительно более способной, чем GPT-6 Astra.

Предложенный результат в обзоре объясняется через водоворот при очень специальных условиях. Вихрь продолжает растягиваться, а скорость неограниченно растёт за конечное время. Такое поведение названо сингулярностью, или неограниченным ростом скорости за конечное время (blow-up). Автор обзора интерпретирует его как свидетельство возможного нарушения привычного описания при определённых условиях. Для работы, по его словам, использовались десять тысяч одновременно действующих агентов на протяжении 88 часов. На показанном сравнении внутренняя модель лучше решает открытые математические задачи. Автор сопоставляет эти 88 часов с названными десятилетиями работы людей и оценивает сообщение как крупный математический прорыв.

Далее в обзоре разделены версии задачи и указаны существенные ограничения результата. Более простой вариант связан с уравнениями Эйлера, где убрана вязкость. Вязкость поясняется как густота жидкости: мёд более вязкий, чем вода. Ещё одно различие — наличие внешней силы. Пример такой силы — перемешивание воды: оно направляет происходящее и помогает добиться нужных условий. Примерно тогда же, по рассказу автора, математики, один из которых связан с Anthropic, решили более простой вариант уравнений Эйлера с внешней силой.

В объявленном результате OpenAI внешняя сила присутствует, но вязкость жидкости сохраняется. В обзоре этот результат представлен как более трудный, чем пример без вязкости. Задача без внешней силы всё ещё не решена. Остаётся вопрос, может ли вода или газ самостоятельно прийти к сингулярности, когда никто не перемешивает жидкость и не направляет её в нужный вихрь. Задача Навье — Стокса без внешней силы остаётся открытой. Автор всё равно сохраняет оценку события как важного прорыва и ожидает дальнейшего ускорения таких достижений.

Show-Harness: зрительная модель выбирает действия робота

Show-Harness исследует вопрос, можно ли управлять роботом при помощи обычной модели, понимающей изображения. В описанном подходе существующей модели, понимающей изображения и текст, дают список понятных движений: переместиться влево, повернуться, пойти вперёд или что-то переместить. Она смотрит на сцену, рассуждает о следующем шаге и выбирает действие из этого набора. Здесь важно различие: сама по себе это зрительно-языковая модель, а не модель непосредственного управления роботом. Поэтому выбранные команды проходят через интерпретатор действий, специфичный для робота, который переводит их в реальные движения.

По сообщению автора, такая схема работает, а успешность может достигать 100%, если модель получает осмысленные названия действий. Далее подход оформляется в программную оболочку, куда можно подключить разные зрительно-языковые модели — Gemini, GPT и открытые варианты, названные Qwen или GLM. GitHub-репозиторий с инструкциями уже опубликован. Отдельно оговорено условие применения: для этой схемы нужен настоящий робот, а наличие одной модели и кода не заменяет робототехническое оборудование.

Edge0: загрузка только необходимых экспертов

Edge0 представлен как способ запускать большие языковые модели на устройствах, которым не хватает памяти для полного набора параметров модели. Он рассчитан на смесь экспертов и объясняется на модели, названной Qwen 3.5 35B. Такую структуру можно сравнить с командой специалистов: запрос направляется только к нужным экспертам, например математический вопрос — к соответствующему специалисту. В приведённом описании у этой модели во время работы активны лишь три миллиарда параметров из 35 миллиардов. Но обычный запуск всё равно требует разместить в памяти полную модель. Edge0 вместо этого подгружает только экспертов, необходимых для текущего вопроса, связывая потребление памяти прежде всего с активной частью.

Дополнительно модель сжата до Int4 — формата с более компактным хранением чисел. При сжатии возможна потеря качества; Recover-LoRA представлен как способ вернуть значительную часть потерянного качества. В показанной таблице для версии с 35 миллиардами параметров пиковый активный расход памяти равен 2,9 ГиБ (около 3,1 ГБ), для меньшей версии на восемь миллиардов — 1 ГиБ (около 1,1 ГБ). Обе проверяли на Mac mini M4 Pro с 24 ГБ памяти при коротком контексте; числа описывают активный расход модели, а не всю память компьютера. Меньшая версия основана на Ling 3.0 Tiny от Inclusion AI. В итоге механизм сочетает выборочную подгрузку, сжатие и восстановление качества. На странице есть инструкции по скачиванию и запуску на Mac.

Real-SWE: требования компании сложнее написания кода

Real-SWE автор противопоставляет программным тестам, названным SWE-bench и DeepSWE, которые, по его оценке, быстро насыщаются: модели уже решают большую долю заданий. Новый тест проверяет работу с реальным программным обеспечением компаний: агент получает доступ к закрытому коду и должен выполнить изменение, важное для бизнеса. Среди примеров — исправление расчёта налогов в счетах и миграция клиентских аккаунтов. В обзоре сложность связана с пониманием устройства конкретного продукта и правил, распределённых между разными системами. Частая неудача — пропустить требование. Поэтому написать код недостаточно: нужно выяснить всё, что должно измениться, и правильно соединить результат с существующим продуктом.

Результаты в этой постановке остаются ниже 40% даже у Fable и GPT-6. В таблице, приведённой 13 сентября, Fable 5.1 занимает первую строку с 38,8%, GPT-6 Astra — вторую с 33,8%, Gemini 3.8 Flash — третью, а лучшая открытая модель GLM 5.3 — четвёртую. Проценты для двух последних в обзоре не названы. Там же сделана оговорка, что значимого различия между всеми четырьмя нет: статистически они фактически делят первое место.

Suno V6: генерация песни и правки отдельных её частей

Suno V6, по описанию автора, расширяет контроль и над созданием песни с нуля, и над её последующим точечным редактированием. Источником новой музыки может быть текстовый запрос или аудиообразец. Но главным в этом эпизоде названы конкретные изменения по инструкции: заменить одну строку текста, не затрагивая остальную песню; соединить вокал из одной композиции с инструментом из другой; выделить гитарный рифф и построить на его основе бит. Затем воспроизводится музыкальная демонстрация.

В обзоре представлены три выпущенных варианта. Обычная V6 доступна в платных тарифах и рассчитана на надёжные, точные результаты. V6 wild также относится к платным планам, но описана как менее предсказуемая и более вариативная, подходящая для неожиданных идей. V6 mini открыта всем, включая бесплатный тариф: она значительно быстрее, однако уступает V6 по качеству и точности. Там же отмечены закрытость и платный характер Suno, а также появившиеся ограничения, в том числе на скачивания.

YuE2: сначала музыкальный план, затем готовая песня

Следующий открытый музыкальный генератор — YuE2. Его особенность — промежуточный музыкальный план. Модель не переходит прямо от текстового запроса к финальному звуку, а сначала составляет нечто ближе к партитуре: в этом представлении есть мелодия, ритм, аккорды и структура. План можно дополнительно редактировать, после чего модель превращает его в полноценную песню с вокалом и сопровождением. В обзоре описана потенциальная возможность менять мелодию, слова, темп и аранжировку через этот музыкальный план, вместо того чтобы только уточнять запросы и надеяться на нужный результат.

Для знакомства с результатом звучат несколько музыкальных примеров. В одном английский вокал обращается к Джону, говорит о ритме, буги-вуги и желании танцевать. Другой содержит мотивы Ночи всех святых, посещения соседей, памяти об ушедших, сладостей и сочетания радости с печалью. Эти примеры демонстрируют готовые песни с вокалом. Отдельно названа возможность делать каверы: в качестве конкретного примера Jingle Bells передают модели, чтобы заново исполнить мелодию в минорной тональности.

По показанным тестам разработчики, как передаёт автор, считают YuE2 лучшей открытой моделью, выше Minimax Music 3 и ACE-Step 1.5, и даже заявляют более высокое качество песен, чем у Suno V6. На странице уже доступны материалы проекта и GitHub с инструкциями по скачиванию и локальному запуску. Размер модели автор называет равным 7,3 ГБ и на этой основе предполагает, что она сможет работать на большинстве потребительских видеокарт.

ChatGPT for Financial Services: данные, расчёты и проверяемые источники

ChatGPT for Financial Services описан как сочетание GPT-6 Astra с финансовыми наборами данных и инструментами для банковских исследований. Среди перечисленных задач — исследование компаний, построение финансовых моделей и оформление результатов в таблицы, документы или презентации. Среди поставщиков данных названы PitchBook и CrunchBase. Важная отдельная возможность — проследить числовой показатель до конкретной таблицы или текстового фрагмента, чтобы аналитик мог проверить, откуда он взялся. Компании также могут передавать собственные шаблоны, и результат должен следовать их привычному формату.

Автор предполагает, что такие функции могут автоматизировать значительный объём финансовой работы, но это его оценка возможного применения. Доступ к продукту пока ограничен. Для запроса доступа нужно обратиться к отделу продаж через страницу.

UMR: перенос человеческого движения с учётом тела робота

UMR расшифровывается как Unified Motion Retargeting и переносит движения человека в движения, на которых может учиться гуманоидный робот. Прямое копирование неудобно: у человека и робота различаются пропорции, суставы и допустимые пределы движения. UMR представляет поверхности обоих тел как наборы трёхмерных точек, а затем обучается соответствиям между ними. Так форма человеческой позы сопоставляется с телом робота при соблюдении его ограничений.

По описанию автора, подход помогает сохранять контакты с предметами и окружением. Простые примеры — взять мяч или сесть на стул. Среди более сложных движений перечислены удары ногой с разворотом, подъём по лестнице и игра в теннис. Результат в обзоре описан как повторное использование человеческих данных о движении на разных роботах без ручной переработки каждого движения. Код уже опубликован, а в репозитории есть инструкции по локальной настройке.

Unitree UnifoLM-WLA: действия рук и координация всего тела

Открытая модель Unitree названа UnifoLM-WLA и содержит шесть миллиардов параметров. На вход она получает то, что видит робот, инструкцию и сведения о текущем состоянии, а затем выдаёт действия. По рассказу автора, одна модель покрывает 64 задачи: 54 относятся к работе за столом, ещё десять — к координации всего тела. Поддерживаются двухпальцевые захваты и разные пятипальцевые робототехнические кисти, поэтому набор не привязан только к одному типу рабочего органа. Автор подчёркивает сочетание широкого перечня заданий с небольшим, в его оценке, размером модели.

Ключевая идея обучения — предсказывать, какие части сцены изменятся в ходе взаимодействия. Пример — складывание полотенца: робот должен заранее учитывать относящееся к задаче движение в сцене. Этот прогноз связан с компонентом, генерирующим следующие действия робота.

Демонстрации включают загрузку белья в стиральную машину. В другой последовательности робот берёт бутылку и выбрасывает её, затем достаёт мусорный пакет, идёт к мусорному контейнеру и выбрасывает туда мусор. В этом примере требуется координация всего тела. Ещё один пример сочетает манипуляции с предметами и перемещение по кухне. Опубликованы модели и обучающий набор данных. При выборе Models доступна загрузка модели; её размер меньше девяти гигабайт. Автор обзора предполагает, что это позволит разместить модель непосредственно в роботе для локальной автономной работы.

MiniCPM5-2B: небольшая модель и её обучающие данные

Ещё одна новая модель — MiniCPM5-2B от OpenBMB. Она представлена как маленькая модель для автономной работы на периферийных устройствах. У неё два миллиарда параметров. В показанных тестах перечислены рассуждение о коде, математика, выполнение инструкций и общие знания. Автор считает модель передовой среди вариантов сопоставимого размера и утверждает, что в среднем она превосходит даже Qwen 3.5 4B и другие небольшие модели.

Вместе с моделью выпускается качественный обучающий набор данных, лежащий в основе её подготовки. Этот набор, согласно обзору, можно получить отдельно для обучения собственной маленькой модели. Для MiniCPM на странице Hugging Face в обзоре указан размер примерно пять гигабайт. Автор предполагает, что такой объём позволит разместить её на большинстве потребительских устройств.