Продукт и природа бага

Продукт называется Runway Characters — модель реального времени для диалога с AI-сгенерированными аватарами с нулевой задержкой; согласно официальному посту Runway, система строит естественную синхронизацию губ, мимику и движения головы на 24 кадрах в секунду в HD-качестве на основе одного референсного изображения. 28 июля 2026 года VentureBeat пересказал доклад Ryan Phillips, руководителя корпоративного продукта Runway, с конференции Transform. Сюжет практический: команда неделями пыталась исправить упрямый баг генерации реального времени — AI-аватары «уплывали» из центра кадра. Итоговое решение оказалось не глубоким исправлением в самой модели, а функцией на стороне интерфейса, которая просто обходит ограничение.

Технический стек и источник проблемы

Технический путь, описанный в докладе: тяжёлое предобучение базовой модели → дистилляция для получения задержки реального времени → состязательное дообучение (APT), чтобы вернуть чёткость изображения, потерянную при сжатии. Побочный эффект дистилляции и APT — дрейф персонажа от центра кадра.

Решение через переупаковку ограничения

Ключевое наблюдение команды: если исходное изображение пользователя идеально отцентровано, генерация остаётся стабильной. Вместо бесконечной погони за исправлением на уровне бэкенда Runway добавила опцию «Оптимизация под качество изображения» — автоматическое перецентрирование входного кадра перед генерацией. Ограничение модели упаковано как полезная функция интерфейса.

Культура оценки качества и инфраструктура

Отдельно Phillips разбирает культуру оценки в компании: определение качества — не чисто инженерная задача, а согласование между продуктом, дизайном, исследованиями и продажами. Внутренние семинары с разбором конкретных примеров формируют общий словарь типичных сбоев. Набор для оценки должен покрывать реальные сценарии клиентов и пограничные случаи — например, персонаж без носа и с необычными зубами: сбоем считается даже устойчивое лицо, если «плывёт» фон. Отслеживание идёт через таблицы с ежедневными мелкими и крупными сбоями против доли успешных прохождений; для масштаба используется визуальная оценка с помощью языковой модели. По инфраструктуре: цель — 24 кадра в секунду по всему миру. После запуска 8% вызовов API падали до 16 кадров в секунду; отладка через AI-агента на базе Claude вместе с Datadog и Sentry выявила аномалию в регионе us-east-1, решённую оптимизациями кеширования, параллельного декодирования и изменениями на уровне ядра совместно с Nvidia. Урок для real-time AI-видео: дрейф качества, SLO по задержке и честный интерфейс вокруг ограничений модели — части одной системы, а не отдельные проблемы.

Технический стек под капотом

Runway Characters построен на модели GWM-1 (General World Model) и генерирует видео авторегрессивно, кадр за кадром, с параллельным исполнением конвейера: диффузионный трансформер занимает 151 мс, VAE-декодер — 119 мс, оба этапа считаются одновременно. По данным официального поста, чистое время модели на кадр — 37 мс, серверная задержка от конца реплики пользователя до первого кадра ответа — 1,75 секунды, а с учётом сетевой передачи между клиентом и сервером полный round-trip доходит примерно до 400 мс. Для достижения такой скорости команда применила тензорно-параллельное шардирование диффузии между устройствами, управление KV-кешем с вытеснением и сжатием для temporal-консистентности, CUDA Graphs для снижения накладных расходов на запуск ядер и настроенные fused-ядра внимания и матричного умножения на Triton.

Продукт, запущенный 4 мая 2026 года, не ограничивается диалогом с аватаром: доступны компьютерное зрение через веб-камеру и демонстрацию экрана, кастомные голоса — как дизайн голоса с нуля, так и мгновенное клонирование, вызов внешних инструментов (tool calling) для действий на бэкенде, подключение базы знаний под конкретный домен, а также встраивание виджета через одну строку кода и интеграция с Zoom, Google Meet и Microsoft Teams.

Официальные источники

Факты проверены 5 августа 2026 г.