GRADIO · GOOGLE GENAI GEMINI FLASH 2.0

YouTube-Chat-AI

Converse com qualquer vídeo do YouTube em segundos, extraindo insights, tópicos fundamentais e citações exatas com link de timestamp.

Modelo LLM
Gemini 2.0 Flash
Interface
Gradio Web UI
Janela de Tokens
Até 1M tokens
Licença
MIT

TL;DR Executivo — Resumo da Engenharia

O YouTube-Chat-AI é uma aplicação de inteligência artificial criada por Alex Santos que revoluciona o aprendizado a partir de vídeos do YouTube. Utilizando a API do Google GenAI com o modelo de alta velocidade Gemini 2.0 Flash, o sistema recebe a URL de qualquer vídeo, obtém suas legendas em múltiplos idiomas, indexa o conteúdo em blocos semânticos e fornece uma interface de chat interativa em Gradio onde o usuário pode fazer perguntas sobre a aula ou podcast e receber respostas com links que saltam para o segundo exato da fala.

DIAGRAMA & WORKFLOW

Arquitetura de Fluxo do Sistema

Visão macro de como o projeto processa requisições, gerencia dados e entrega valor técnico com máxima eficiência.

Fluxo Lógico & Pipeline de Execução
+-----------------------+      +---------------------------+      +-----------------------+
|  URL do Vídeo YouTube | ===> | YouTube Transcript API    | ===> | Transcrição Completa  |
|  (Palestra / Podcast) |      | (Extração de Legendas)    |      | (Texto com Timestamps)|
+-----------------------+      +---------------------------+      +-----------------------+
                                                                              |
+-----------------------+      +---------------------------+                  v
| Interface Gradio      | <=== | Google Gemini Flash 2.0   | <=== +-----------------------+
| (Chat & Resumos)      |      | (Raciocínio Long-Context) |      | Chunking Semântico    |
+-----------------------+      +---------------------------+      +-----------------------+
ENGENHARIA DETALHADA

Os Pilares Técnicos Fundamentais

Decisões de design, algoritmos e técnicas aplicadas para garantir confiabilidade, segurança e excelência operacional.

01

Extração Resiliente de Legendas e Transcrições

Suporte a legendas oficiais, manuais e transcrições automáticas

O sistema utiliza a biblioteca `youtube-transcript-api` com fallback progressivo. Se o vídeo não tiver legendas oficiais em português, o motor busca faixas em inglês e aplica tradução dinâmica ou utiliza a versão gerada automaticamente pelo algoritmo do YouTube.

02

Indexação com Preservação de Âncoras Temporais

Cada resposta do chat referencia o momento exato em que o autor falou

Em vez de concatenar a transcrição como um bloco opaco de texto, o pipeline retém as marcas de início e duração de cada trecho. Quando o Gemini gera uma citação ou resposta a uma pergunta factual, ele insere hiperlinks com o formato `t=124s`, permitindo ao estudante clicar e assistir ao trecho original.

03

Aproveitamento da Janela Ampla do Gemini 2.0 Flash

Capacidade de engolir podcasts inteiros de 3 horas sem estourar contexto

Diferente de sistemas legados que exigem banco de dados vetorial complexo (RAG) para vídeos médios, a janela de contexto de 1 milhão de tokens do Gemini Flash 2.0 permite alimentar toda a transcrição em um único prompt de alta fidelidade com baixíssima latência e custo reduzido.

04

Interface Gradio Reativa e Histórico Conversacional

Experiência fluida para estudos, pesquisas e sínteses executivas

Construído em Gradio com suporte a streaming de tokens em tempo real. Inclui botões de atalho rápido para "Gerar Resumo em Tópicos", "Listar Principais Conceitos", "Extrair Perguntas e Respostas" e campo aberto para diálogo contínuo.

IMPLEMENTAÇÃO EM CÓDIGO

Código em Prática

Exemplo concreto de uso, configuração e integração técnica.

Código Central — Extração e Invocação com Google GenAI PYTHON
from google import genai
from youtube_transcript_api import YouTubeTranscriptApi

client = genai.Client(api_key="SUA_API_KEY")

def processar_video(video_id: str, pergunta: str):
    transcript = YouTubeTranscriptApi.get_transcript(video_id, languages=['pt', 'en'])
    texto_formatado = "\n".join([f"[{int(item['start'])}s] {item['text']}" for item in transcript])
    
    prompt = f"Transcrição do vídeo:\n{texto_formatado}\n\nPergunta do usuário: {pergunta}\nResponda indicando o timestamp exato."
    
    response = client.models.generate_content(
        model="gemini-2.0-flash",
        contents=prompt
    )
    return response.text
DÚVIDAS & DECISÕES

Perguntas Frequentes & Respostas Técnicas

Esclarecimentos detalhados sobre funcionamento, licenças, compatibilidade e privacidade.

O YouTube-Chat-AI funciona com vídeos que não têm legendas ativadas?

O sistema requer que o vídeo tenha pelo menos a transcrição automática ativada pelo YouTube. Para vídeos sem qualquer legenda, o YouTube Transcript API não consegue capturar o áudio.

O Gemini 2.0 Flash é gratuito para uso nesta aplicação?

O Google AI Studio oferece cotas gratuitas generosas para o modelo Gemini 2.0 Flash, tornando a aplicação praticamente gratuita para uso pessoal.

É possível salvar o histórico da conversa para consultar depois?

Sim, a interface inclui uma opção de exportação do diálogo e resumo em formato Markdown para salvar em seu Obsidian ou Notion.

Qual o tempo médio de resposta para um vídeo de 1 hora?

A extração da legenda leva menos de 1 segundo, e o Gemini Flash 2.0 começa a responder via streaming em menos de 1.5 segundo.