DOCKER · GPU NVIDIA · OPENAI-COMPATIBLE API

kokoro-82m-tts

Solução completa e pronta para produção do modelo Kokoro-82M: container Docker otimizado para GPU, API compatível com OpenAI e vozes em português brasileiro.

Modelo Base
Kokoro-82M (82M params)
Container
Docker + NVIDIA CUDA
Vozes PT-BR
pf_dora, pm_alex, pm_santa
API Endpoint
/v1/audio/speech

TL;DR Executivo — Resumo da Engenharia

O kokoro-82m-tts é uma evolução de engenharia do modelo Kokoro-82M desenvolvida por Alex Santos. O repositório original continha apenas uma biblioteca Python crua para instalação via pip, sem API REST, sem containerização e sem documentação em português. Alex empacotou todo o ecossistema em um container Docker otimizado com suporte a GPU NVIDIA, construiu um servidor web de alta velocidade com API 100% compatível com a especificação da OpenAI (`/v1/audio/speech`), adicionou 3 vozes nativas em Português Brasileiro (pf_dora, pm_alex e pm_santa) e escreveu uma suíte com 7 testes automatizados de validação.

DIAGRAMA & WORKFLOW

Arquitetura de Fluxo do Sistema

Visão macro de como o projeto processa requisições, gerencia dados e entrega valor técnico com máxima eficiência.

Fluxo Lógico & Pipeline de Execução
+-----------------------+      +---------------------------+      +-----------------------+
| App Cliente           | HTTP | Container Docker Kokoro   | CUDA | GPU NVIDIA (CUDA)     |
| (Qualquer app OpenAI) | ===> | (FastAPI /v1/audio/speech)| ===> | Modelo Kokoro-82M     |
+-----------------------+      +---------------------------+      +-----------------------+
                                             |
                                             v
                               +---------------------------+
                               | Síntese Fonética PT-BR    |
                               | (pf_dora, pm_alex...)     |
                               +---------------------------+
                                             |
                                             v
                               +---------------------------+
                               | Áudio WAV/MP3 Streaming   |
                               +---------------------------+
ENGENHARIA DETALHADA

Os Pilares Técnicos Fundamentais

Decisões de design, algoritmos e técnicas aplicadas para garantir confiabilidade, segurança e excelência operacional.

01

Containerização Docker com Suporte a CUDA

Deploy reproduzível em um único comando sem conflitos de dependências

Instalar bibliotecas de áudio e PyTorch diretamente no host costuma gerar inferno de versões de CUDA e drivers de áudio. A imagem Docker oficial criada no projeto empacota o runtime NVIDIA CUDA, as dependências do Kokoro e o servidor FastAPI em um ambiente isolado pronto para uso.

02

Compatibilidade 100% com a API OpenAI (/v1/audio/speech)

Substituto drop-in para economizar custos de API sem alterar clientes

O endpoint aceita a mesma assinatura da API da OpenAI (`model`, `input`, `voice`, `response_format`). Qualquer aplicação que já utilize o SDK oficial da OpenAI pode apontar o `base_url` para o IP do container e usufruir de síntese local instantânea com custo zero por caractere.

03

Três Vozes Naturais em Português Brasileiro (pt-BR)

Modelagem fonética com entonação coloquial e fluidez humana

Adicionou suporte a três vozes brasileiras de altíssima qualidade: `pf_dora` (voz feminina jovem e expressiva), `pm_alex` (voz masculina clara para tutoriais e documentários) e `pm_santa` (voz masculina institucional grave), superando robôs tradicionais de sintetização.

04

Suíte de Testes Automatizada com 7 Cenários de Borda

Garantia de estabilidade e ausência de estouros de memória sob carga contínua

O repositório inclui um script de testes automatizado (`test_tts_suite.py`) que valida: streaming de áudio contínuo, limites de tamanho de prompt (textos longos de 1.000+ caracteres), geração de múltiplos formatos (WAV, MP3, AAC), sanitização de caracteres especiais e medição de latência RTF (Real-Time Factor < 0.1).

IMPLEMENTAÇÃO EM CÓDIGO

Código em Prática

Exemplo concreto de uso, configuração e integração técnica.

Terminal — Execução do Container e Chamada cURL Compatível com OpenAI BASH
# 1. Rodar o container com suporte a GPU NVIDIA
docker run -d --gpus all -p 8880:8880 \
  --name kokoro-tts \
  ghcr.io/alexlivre/kokoro-82m-tts:latest

# 2. Gerar áudio via cURL com voz brasileira
curl -X POST http://localhost:8880/v1/audio/speech \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kokoro",
    "voice": "pm_alex",
    "input": "Olá! Este áudio foi sintetizado localmente com o modelo Kokoro 82M.",
    "response_format": "mp3"
  }' --output audio_sintetizado.mp3
DÚVIDAS & DECISÕES

Perguntas Frequentes & Respostas Técnicas

Esclarecimentos detalhados sobre funcionamento, licenças, compatibilidade e privacidade.

O Kokoro-82M precisa de muita VRAM para rodar com GPU?

Não. Por ter apenas 82 milhões de parâmetros, o modelo consome apenas cerca de 1.2 GB de VRAM na GPU, podendo rodar confortavelmente até mesmo em placas mais modestas como a GTX 1650 ou RTX 3050.

Posso usar o container em modo CPU caso não tenha GPU dedicada?

Sim, a imagem possui fallback automático para execução via CPU com suporte a multithreading no PyTorch.

Como integrar com o SDK oficial da OpenAI em Python?

Basta instanciar o cliente com: OpenAI(base_url="http://localhost:8880/v1", api_key="not-needed") e invocar client.audio.speech.create(...).

O projeto tem suporte a outros idiomas além do português?

Sim, o modelo base Kokoro suporta inglês (americano e britânico), além de outros idiomas europeus e asiáticos.