COMPUTER VISION · MULTI-PROVIDER MCP

omni-image-tools-mcp

Ponte completa entre agentes de inteligência artificial e visão computacional avançada, com processamento híbrido local e em nuvem.

Linguagem
Python 3.10+
Protocolo
FastMCP / MCP Spec
Provedores
Ollama, OpenRouter, OpenAI
GPU Support
Detecção Automática CUDA

TL;DR Executivo — Resumo da Engenharia

O omni-image-tools-mcp é um servidor MCP projetado para resolver o isolamento dos modelos de linguagem em relação a tarefas visuais complexas. Ele oferece 11 ferramentas que combinam Computer Vision analítica (OCR, leitura de gráficos, detecção de elementos de UI) com processamento de mídia (conversões de formato, redimensionamento sem perda, compressão WebP e remoção de metadados EXIF). Sua maior inovação é a camada multi-provedor com detecção de VRAM, alternando com elegância entre modelos locais via Ollama e provedores em nuvem.

DIAGRAMA & WORKFLOW

Arquitetura de Fluxo do Sistema

Visão macro de como o projeto processa requisições, gerencia dados e entrega valor técnico com máxima eficiência.

Fluxo Lógico & Pipeline de Execução
                           +---------------------------+
                           |  Agente MCP / LLM Client  |
                           +---------------------------+
                                         |
                                         v
                           +---------------------------+
                           |   omni-image-tools-mcp    |
                           +---------------------------+
                                         |
            +----------------------------+---------------------------+
            |                                                        |
            v                                                        v
+------------------------+                               +------------------------+
|  Processamento Local   |                               |      Inferência AI     |
| (Pillow / EXIF Stripper|                               | (Multi-Provider Bridge)|
| Conversão WebP/PNG)    |                               +------------------------+
+------------------------+                                           |
                                               +---------------------+---------------------+
                                               |                     |                     |
                                               v                     v                     v
                                      +-----------------+   +-----------------+   +-----------------+
                                      | Ollama (Local)  |   |   OpenRouter    |   |  OpenAI Vision  |
                                      | (VRAM Detection)|   |  (Claude/Qwen)  |   |    (GPT-4o)     |
                                      +-----------------+   +-----------------+   +-----------------+
ENGENHARIA DETALHADA

Os Pilares Técnicos Fundamentais

Decisões de design, algoritmos e técnicas aplicadas para garantir confiabilidade, segurança e excelência operacional.

01

Camada de Abstração Multi-Provedor Unificada

Um único contrato de chamada para múltiplos backends de visão

Elimina o acoplamento com um único fornecedor de IA. O desenvolvedor ou agente solicita a análise visual (`analyze_image`), e o omni-image-tools-mcp direciona a requisição para o provedor configurado como preferencial (Ollama local, OpenRouter ou OpenAI), traduzindo respostas e esquemas de imagem de forma uniforme.

02

Gerenciamento Automático de GPU e VRAM

Prevenção de Out-Of-Memory (OOM) no ecossistema local

Ao utilizar o backend Ollama com modelos pesados como LLaVA ou Qwen-VL, o servidor consulta a memória livre da GPU via `torch.cuda` antes de submeter o prompt. Caso a VRAM esteja saturada por outra aplicação, o servidor executa graceful fallback para CPU com quantização leve ou delega a tarefa para OpenRouter.

03

Pipeline de Processamento e Conversão de Mídias

Manipulação performática usando a biblioteca Pillow em Python

Disponibiliza ferramentas dedicadas de edição técnica: recorte por coordenadas de bounding box, redimensionamento preservando aspect ratio, compressão inteligente com redução de peso em até 70% e conversão rápida entre JPEG, PNG, WebP e AVIF.

04

Sanitização de Metadados e Higiene de Privacidade

Remoção total de tags EXIF sensíveis antes de qualquer processamento

Fotografias capturadas por smartphones contêm coordenadas GPS, número de série da câmera e datas exatas. A ferramenta `sanitize_image` remove todas as informações de identificação pessoal (PII) embutidas nos metadados, garantindo segurança na submissão de arquivos a modelos externos.

IMPLEMENTAÇÃO EM CÓDIGO

Código em Prática

Exemplo concreto de uso, configuração e integração técnica.

Exemplo de Uso — Chamada Programática da Ferramenta de Análise PYTHON
# Invocação da ferramenta via cliente MCP compatível em Python
response = await client.call_tool("omni-image-tools-mcp", "analyze_image", {
    "image_path": "/caminho/para/dashboard_screenshot.png",
    "prompt": "Extraia todos os números e tendências de crescimento apresentados no gráfico.",
    "provider": "ollama",
    "model": "qwen2.5-vl:7b",
    "detail": "high"
})

print(response.content[0].text)
DÚVIDAS & DECISÕES

Perguntas Frequentes & Respostas Técnicas

Esclarecimentos detalhados sobre funcionamento, licenças, compatibilidade e privacidade.

É obrigatório ter uma placa de vídeo NVIDIA para rodar o servidor?

Não. Se você não tiver GPU dedicada, pode utilizar os provedores de nuvem (OpenRouter ou OpenAI) ou rodar modelos ultraleves via CPU no Ollama.

Quais formatos de imagem são suportados para processamento?

São suportados os formatos PNG, JPEG/JPG, WebP, BMP, TIFF e GIF estático.

O servidor expõe logs de telemetria para a internet?

Não. Todo o tráfego do servidor é restrito ao canal stdio local da máquina onde está sendo executado.

Como alternar o provedor padrão de IA?

Basta configurar a variável de ambiente DEFAULT_VISION_PROVIDER para "ollama", "openrouter" ou "openai".