---
read_when:
    - Ищете обзор возможностей OpenClaw для работы с медиафайлами
    - Выбор поставщика мультимедиа для настройки
    - Как работает асинхронная генерация медиаконтента
sidebarTitle: Media overview
summary: Краткий обзор возможностей для работы с изображениями, видео, музыкой, речью и анализа медиаконтента
title: Обзор медиафайлов
x-i18n:
    generated_at: "2026-07-13T18:50:08Z"
    model: gpt-5.6
    postprocess_version: locale-links-v1
    prompt_version: 24
    provider: openai
    source_hash: f7d7bf8bd2052cdba088d7a612bb89b0fc3a95b3635c7fcd2138eb731121b85f
    source_path: tools/media-overview.md
    workflow: 16
---

OpenClaw генерирует изображения, видео и музыку, понимает входящие медиафайлы
(изображения, аудио и видео) и озвучивает ответы с помощью синтеза речи. Все
медиавозможности реализуются через инструменты: агент решает, когда их использовать,
исходя из контекста разговора, а каждый инструмент появляется только при наличии
хотя бы одного настроенного провайдера.

Для живой речи используется контракт сеанса Talk, а не путь одноразового
медиаинструмента. Talk поддерживает три режима: нативный для провайдера `realtime`,
локальный или потоковый `stt-tts` и `transcription` для захвата речи
только в режиме наблюдения. Эти режимы используют общие каталоги провайдеров,
конверты событий и семантику отмены с телефонией, встречами, браузерным
взаимодействием в реальном времени и нативными клиентами с функцией «нажми и говори».

## Возможности

<CardGroup cols={2}>
  <Card title="Генерация изображений" href="/ru/tools/image-generation" icon="image">
    Создание и редактирование изображений по текстовым запросам или референсным
    изображениям через `image_generate`. Асинхронно в сеансах чата — выполняется
    в фоновом режиме и публикует результат по готовности.
  </Card>
  <Card title="Генерация видео" href="/ru/tools/video-generation" icon="video">
    Преобразование текста в видео, изображения в видео и видео в видео через
    `video_generate`. Асинхронно — выполняется в фоновом режиме и публикует
    результат по готовности.
  </Card>
  <Card title="Генерация музыки" href="/ru/tools/music-generation" icon="music">
    Генерация музыки или звуковых дорожек через `music_generate`. Асинхронно
    в сеансах чата, с использованием общего жизненного цикла задач генерации медиа.
  </Card>
  <Card title="Синтез речи" href="/ru/tools/tts" icon="microphone">
    Преобразование исходящих ответов в озвученное аудио с помощью инструмента
    `tts` и конфигурации `messages.tts`. Синхронно.
  </Card>
  <Card title="Понимание медиа" href="/ru/nodes/media-understanding" icon="eye">
    Создание сводок по входящим изображениям, аудио и видео с помощью провайдеров
    моделей с поддержкой компьютерного зрения и специализированных плагинов
    понимания медиа.
  </Card>
  <Card title="Распознавание речи" href="/ru/nodes/audio" icon="ear-listen">
    Транскрибирование входящих голосовых сообщений с помощью пакетных провайдеров
    STT или провайдеров потокового STT для Voice Call.
  </Card>
</CardGroup>

## Матрица возможностей провайдеров

<Note>
Эта таблица охватывает специализированные плагины генерации медиа, TTS и STT.
Многие провайдеры чат-моделей (Anthropic, Google, OpenAI и другие) также понимают
входящие медиа с помощью своей модели ответов; полный список провайдеров приведён
в разделе [Понимание медиа](/ru/nodes/media-understanding#provider-support-matrix).
</Note>

| Провайдер         | Изображения | Видео | Музыка | TTS | STT | Голос в реальном времени | Понимание медиа |
| ----------------- | :---------: | :---: | :----: | :-: | :-: | :----------------------: | :-------------: |
| Alibaba           |             |   ✓   |        |     |     |                          |                 |
| Azure Speech      |             |       |        |  ✓  |     |                          |                 |
| BytePlus          |             |   ✓   |        |     |     |                          |                 |
| ComfyUI           |      ✓      |   ✓   |   ✓    |     |     |                          |                 |
| Deepgram          |             |       |        |     |  ✓  |                          |                 |
| DeepInfra         |      ✓      |   ✓   |        |  ✓  |  ✓  |                          |        ✓        |
| ElevenLabs        |             |       |        |  ✓  |  ✓  |                          |                 |
| fal               |      ✓      |   ✓   |   ✓    |     |     |                          |                 |
| Google            |      ✓      |   ✓   |   ✓    |  ✓  |  ✓  |            ✓             |        ✓        |
| Gradium           |             |       |        |  ✓  |     |                          |                 |
| Inworld           |             |       |        |  ✓  |     |                          |                 |
| LiteLLM           |      ✓      |       |        |     |     |                          |                 |
| Локальный CLI     |             |       |        |  ✓  |     |                          |                 |
| Microsoft         |             |       |        |  ✓  |     |                          |                 |
| Microsoft Foundry |      ✓      |       |        |     |     |                          |                 |
| MiniMax           |      ✓      |   ✓   |   ✓    |  ✓  |     |                          |                 |
| Mistral           |             |       |        |     |  ✓  |                          |                 |
| OpenAI            |      ✓      |   ✓   |        |  ✓  |  ✓  |            ✓             |        ✓        |
| OpenRouter        |      ✓      |   ✓   |   ✓    |  ✓  |  ✓  |                          |        ✓        |
| PixVerse          |             |   ✓   |        |     |     |                          |                 |
| Qwen              |             |   ✓   |        |     |     |                          |        ✓        |
| Runway            |             |   ✓   |        |     |     |                          |                 |
| SenseAudio        |             |       |        |     |  ✓  |                          |                 |
| Together          |             |   ✓   |        |     |     |                          |                 |
| Volcengine        |             |       |        |  ✓  |     |                          |                 |
| Vydra             |      ✓      |   ✓   |        |  ✓  |     |                          |                 |
| xAI               |      ✓      |   ✓   |        |  ✓  |  ✓  |                          |        ✓        |
| Xiaomi MiMo       |             |       |        |  ✓  |     |                          |                 |

<Note>
**Голос в реальном времени** здесь означает нативное для провайдера двунаправленное
взаимодействие в реальном времени (режим Talk `realtime`, например Gemini Live
или OpenAI Realtime API) — в настоящее время его регистрируют только Google и OpenAI.
Deepgram, ElevenLabs, Mistral, OpenAI и xAI отдельно регистрируют потоковое STT для
Voice Call (однонаправленное преобразование аудио в текст); см. раздел
[Распознавание речи и Voice Call](#speech-to-text-and-voice-call) ниже.
Голос xAI в реальном времени поддерживается вышестоящим сервисом, но не регистрируется
в OpenClaw, пока общий контракт голоса в реальном времени не сможет его представить.
</Note>

## Асинхронный и синхронный режимы

| Возможность     | Режим         | Причина                                                                                                       |
| --------------- | ------------- | ------------------------------------------------------------------------------------------------------------- |
| Изображения     | Асинхронный   | Обработка провайдером может продолжаться после завершения хода чата; созданные вложения используют общий путь завершения. |
| Синтез речи     | Синхронный    | Ответы провайдера возвращаются за несколько секунд и прикрепляются к аудиоответу.                              |
| Видео           | Асинхронный   | Обработка провайдером занимает от 30 с до нескольких минут; медленные очереди могут работать до настроенного тайм-аута. |
| Музыка          | Асинхронный   | Имеет те же характеристики обработки провайдером, что и видео.                                                |

Для асинхронных инструментов OpenClaw отправляет запрос провайдеру, немедленно
возвращает идентификатор задачи и отслеживает задание в реестре задач. Агент
продолжает отвечать на другие сообщения, пока выполняется задание. Когда провайдер
завершает работу, OpenClaw активирует агент, передавая ему пути к созданным
медиафайлам, чтобы он мог сообщить пользователю через обычный видимый режим ответа
сеанса: автоматическую доставку итогового ответа, если она настроена, или
`message(action="send")`, если сеанс требует использования инструмента сообщений.
Если сеанс отправителя неактивен или его активное пробуждение завершается неудачей,
а в ответе о завершении по-прежнему отсутствует часть созданных медиафайлов,
OpenClaw отправляет идемпотентный прямой резервный ответ только с недостающими
медиафайлами. Медиафайлы, уже доставленные в ответе о завершении, повторно
не публикуются.

## Распознавание речи и Voice Call

Deepgram, DeepInfra, ElevenLabs, Google, Groq, Mistral, OpenAI, OpenRouter,
SenseAudio и xAI могут транскрибировать входящее аудио через пакетный путь
`tools.media.audio`, если он настроен. Плагины каналов, которые предварительно
обрабатывают голосовое сообщение для фильтрации по упоминаниям или разбора команд,
помечают транскрибированное вложение во входящем контексте, поэтому общий проход
понимания медиа повторно использует эту транскрипцию вместо второго вызова STT
для того же аудио.

Deepgram, ElevenLabs, Mistral, OpenAI и xAI также регистрируют провайдеров
потокового STT для Voice Call, поэтому звук телефонного разговора в реальном
времени можно передавать выбранному поставщику, не дожидаясь завершения записи.

Для живых разговоров с пользователем предпочтителен [режим Talk](/ru/nodes/talk).
Пакетные аудиовложения остаются на медиапути; звук из браузерного взаимодействия
в реальном времени, нативных клиентов с функцией «нажми и говори», телефонии
и встреч должен использовать события Talk и каталоги в области сеанса,
возвращаемые Gateway.

## Сопоставление провайдеров с поверхностями

<AccordionGroup>
  <Accordion title="Google">
    Поверхности изображений, видео, музыки, пакетного TTS, пакетного STT,
    серверной голосовой связи в реальном времени и понимания медиа.
  </Accordion>
  <Accordion title="OpenAI">
    Поверхности изображений, видео, пакетного TTS, пакетного STT, потокового STT
    для Voice Call, серверной голосовой связи в реальном времени и векторных
    представлений памяти.
  </Accordion>
  <Accordion title="DeepInfra">
    Поверхности маршрутизации чатов и моделей, генерации и редактирования
    изображений, преобразования текста в видео, пакетного TTS, пакетного STT,
    понимания изображений и векторных представлений памяти. DeepInfra также
    предоставляет переранжирование, классификацию, обнаружение объектов и другие
    нативные типы моделей; в OpenClaw пока нет контракта провайдера для этих
    категорий, поэтому данный плагин их не регистрирует.
  </Accordion>
  <Accordion title="xAI">
    Изображения, видео, поиск, выполнение кода, пакетный TTS, пакетный STT
    и потоковый STT для Voice Call. Голос xAI в реальном времени поддерживается
    вышестоящим сервисом, но не регистрируется в OpenClaw, пока общий контракт
    голоса в реальном времени не сможет его представить.
  </Accordion>
</AccordionGroup>

## Связанные разделы

- [Генерация изображений](/ru/tools/image-generation)
- [Генерация видео](/ru/tools/video-generation)
- [Генерация музыки](/ru/tools/music-generation)
- [Синтез речи](/ru/tools/tts)
- [Понимание медиа](/ru/nodes/media-understanding)
- [Аудиоузлы](/ru/nodes/audio)
- [Режим Talk](/ru/nodes/talk)
