В Naia есть два способа использования голосовых разговоров.
Два подхода
Омни-режим
Одна модель ИИ напрямую слушает речь и сразу отвечает голосом. Без промежуточного преобразования она понимает тон и эмоции, обеспечивая естественное и быстрое общение.
STT → LLM → TTS Pipeline
Распознавание речи (STT), текстовый ИИ (LLM) и синтез речи (TTS) комбинируются с использованием разных провайдеров. Вы можете свободно выбирать провайдеров, и полностью бесплатная конфигурация тоже возможна.
Омни-режим
Выберите модель со значком 🗣️ в списке моделей в разделе Настройки > ИИ, чтобы активировать омни-режим.
Gemini Flash Live (облако)
| Провайдер | Модель | API-ключ | Стоимость |
|---|---|---|---|
| Naia Cloud | Gemini 3.1 Flash Live 🗣️ | Не требуется (кредиты) | Списание кредитов |
| Gemini (напрямую) | Gemini 2.5 Flash Live 🗣️ | Google API-ключ | ~$0,03/мин |
8 голосов: Kore (женский, по умолчанию), Puck (мужской), Charon (мужской), Aoede (женский), Fenrir (мужской), Leda (женский), Orus (мужской), Zephyr (нейтральный)
GPT-4o Realtime (облако)
| Провайдер | Модель | API-ключ | Стоимость |
|---|---|---|---|
| OpenAI | GPT-4o Realtime 🗣️ | OpenAI API-ключ | ~$0,10/мин |
10 голосов: Alloy (нейтральный), Ash (мужской), Ballad (мужской), Coral (женский), Echo (мужской), Sage (женский), Shimmer (женский), Verse (мужской), Marin (рекомендуемый), Cedar (рекомендуемый)
MiniCPM-o 4.5 (локально)
Запускайте омни-голосовые разговоры полностью локально через сервер vllm-omni. На данный момент это практически единственная омни-модель, пригодная для локального использования.
Выберите vLLM в качестве провайдера в Настройки > ИИ, чтобы автоматически получить список моделей с сервера. Модели с "minicpm-o" в названии автоматически распознаются как 🗣️.
Требования: Около 35 ГБ VRAM при BF16. Рекомендуется A40 (46 ГБ) или выше, либо GPU с 48 ГБ.
Запуск сервера:
vllm serve openbmb/MiniCPM-o-4_5 \
--omni --port 8091 --host 0.0.0.0 \
--max-model-len 2048 --skip-mm-profiling
Введите адрес сервера vLLM в настройках Naia (например, http://localhost:8091).
Если у вас нет локального GPU, вы можете запустить сервер на облачных GPU, таких как RunPod. См. руководство по RunPod.
В настоящее время поддерживается голосовой ввод и вывод на английском и китайском языках.
Планы на будущее: Планируется поддержка клонирования голоса по аудио-образцу и pipeline для fine-tuning.
STT → LLM → TTS Pipeline
Даже без омни-модели вы можете настроить STT и TTS по отдельности для голосовых разговоров.
STT (Распознавание речи)
Выберите в Настройки > Голос:
| Провайдер | Офлайн | API-ключ | Стоимость |
|---|---|---|---|
| Web Speech API | Нет | Не требуется | Бесплатно |
| Vosk | Да | Не требуется | Бесплатно |
| Whisper | Да | Не требуется | Бесплатно |
| Naia Cloud | Нет | Не требуется (логин) | Кредиты |
| vLLM ASR | Да (локально) | Не требуется | Бесплатно |
TTS (Синтез речи)
Выберите в Настройки > Голос:
| Провайдер | Офлайн | API-ключ | Стоимость |
|---|---|---|---|
| Naia Cloud TTS | Нет | Не требуется (логин) | Кредиты |
| Edge TTS | Нет | Не требуется | Бесплатно |
| Google Cloud TTS | Нет | Требуется | $0,016/1K символов |
| OpenAI TTS | Нет | Требуется | $0,015/1K символов |
| ElevenLabs | Нет | Требуется | $0,30/1K символов |
| vLLM TTS | Да (локально) | Не требуется | Бесплатно |
| Пользовательский | Зависит | Зависит | Зависит |
Нажмите кнопку Прослушать, чтобы протестировать выбранный голос.
Примеры комбинаций
| Среда | STT | LLM | TTS | Стоимость |
|---|---|---|---|---|
| Полностью бесплатно | Vosk | Ollama (локально) | Edge TTS | Бесплатно |
| Бюджетный вариант | Web Speech | Gemini 2.5 Flash | Edge TTS | ~$0,3/1M токенов |
| Высокое качество | Whisper | Claude Sonnet | ElevenLabs | Стоимость API |
| Naia Cloud | Naia Cloud STT | Naia Cloud LLM | Naia Cloud TTS | Только кредиты |
| Полностью локально (GPU) | vLLM ASR | vLLM | vLLM TTS | Бесплатно |