Segurança em LLMs Locais: Proteção no Ollama e vLLM
Aprenda a proteger servidores de inferência de IA com Ollama e vLLM contra vazamentos de memória VRAM e injeções de prompt em 2026.

A segurança em LLMs locais tornou-se em 2026 um pilar obrigatório para empresas que operam modelos de inteligência artificial em infraestrutura própria. Com a crescente utilização do Ollama, vLLM e llama.cpp para processar dados sensíveis sem depender de provedores de nuvem pública, surgiram vulnerabilidades específicas ligadas ao compartilhamento de memória na GPU e à exposição de APIs REST.
A premissa de que rodar modelos localmente garante segurança automática foi desmentida por casos reais de exfiltração de memória gráfica (VRAM) e execução não autorizada de ferramentas no sistema operacional.
Arquitetura de Memória VRAM e Fugas no Cache KV
Frameworks modernos como o vLLM adotam o PagedAttention para particionar a memória de atenção (Key-Value Cache) em blocos dinâmicos. Quando múltiplos usuários ou microsserviços utilizam a mesma placa aceleradora sem limpeza rígida (zeroization) dos buffers, resíduos de tensores de requisições anteriores podem permanecer acessíveis.
Um atacante capaz de formular prompts adversários pode induzir o modelo a gerar respostas contendo dados de sessões anteriores, revelando credenciais, contratos confidenciais ou código proprietário.
Para auditar portas expostas e verificar endpoints de IA, utilize nosso Scanner de Ameaças e Segurança.
Vetores de Ataque em Servidores de Inferência Local
| Vetor de Ataque | Motor Afetado | Impacto Técnico | Ação Corretiva |
|---|---|---|---|
| API REST Exposta (0.0.0.0) | Ollama / vLLM | Download e execução não autorizada de modelos | Reverse proxy Nginx com mTLS e firewall |
| Vazamento Residual no Cache KV | vLLM / llama.cpp | Reconstrução de prompts entre diferentes sessões | Forçar --enforce-eager ou isolar processos |
| Injeção Indireta de Prompt | Ferramentas Ollama | Execução indevida de binários no host | Validação rigorosa de schemas e sandboxing |
| Esgotamento de VRAM (DoS) | Motores Locais | Pânico no driver CUDA e indisponibilidade do serviço | Definir limites estritos de max_model_len |
Endurecimento de Segurança no Ollama e vLLM
A blindagem de um ambiente de inferência exige vincular os serviços a interfaces locais e limitar os privilégios do processo.
Configuração Systemd segura para o serviço Ollama no Linux:
[Service]
Environment="OLLAMA_HOST=127.0.0.1:11434"
Environment="OLLAMA_ORIGINS=https://app.suaempresa.internal"
Environment="OLLAMA_NUM_PARALLEL=4"
# Restrições de privilégios do kernel Linux
ProtectSystem=strict
ProtectHome=true
NoNewPrivileges=true
PrivateTmp=true
Para ambientes corporativos utilizando vLLM:
# Execução segura do vLLM com limite de GPU e autenticação por token
python3 -m vllm.entrypoints.openai.api_server \
--model meta-llama/Llama-3.3-70B-Instruct \
--gpu-memory-utilization 0.85 \
--max-model-len 8192 \
--disable-log-requests \
--api-key "${VLLM_INTERNAL_API_KEY}"
O parâmetro --disable-log-requests impede a persistência de consultas confidenciais em logs de texto simples.
Checklist de Isolamento e Práticas Recomendadas
Para implementar servidores de inferência com segurança corporativa:
- Isolamento de Kernel com gVisor: Execute os contêineres GPU sobre o runtime
runscpara filtrar chamadas de sistema. - Segmentação de Rede: Aloque as máquinas com GPU em VLAN dedicada, aceitando tráfego apenas do gateway de API autenticado.
- Auditoria de Hashes de Modelos: Valide o hash SHA-256 dos pesos
.safetensorsantes do carregamento na VRAM, conforme orientado em nosso guia sobre Integridade de Arquivos e Assinaturas. - Sanitização de Saídas Estruturadas: Valide o formato das respostas JSON produzidas pelos modelos com o nosso Validador e Formatador JSON.
- Monitoramento de Memória GPU: Configure alertas para variações atípicas de consumo de VRAM para prevenir ataques de saturação.
Resumo
Hospedar modelos internamente assegura autonomia sobre os dados, desde que sejam aplicadas as mesmas diretrizes de segurança de bancos de dados sensíveis. O isolamento em localhost, a autenticação por mTLS e o controle de memória VRAM protegem a inferência contra vazamentos.
Normas e Referências:
- OWASP Top 10 for LLM Applications (2025/2026).
- Análise TecnoCrypter: Privacidade e Segurança em Modelos de Linguagem.
- Artigo Técnico: Segurança na Cadeia de Suprimentos de Software e IA.


