O NVIDIA Personal AI Router no GitHub, Personal AI Router (PAIR), já disponível em beta, distribui automaticamente requisições de inferência entre os computadores de uma rede local, com integração nativa a Ollama e LM Studio, segundo anúncio da própria NVIDIA reproduzido pelo InfoQ.
O que o Personal AI Router faz e por que existe
A NVIDIA descreve um padrão cada vez mais comum em cargas de agentes: um agente principal despacha subtarefas para subagentes, ou vários agentes trabalham em conjunto. Isso cria gargalo na GPU local quando ela recebe requisições demais.
O PAIR resolve distribuindo requisições de inferência individuais pelos sistemas disponíveis, com integração a Ollama e LM Studio sem exigir mudanças na arquitetura ou no harness do agente.
Leia também
Openclaw 2.0 chega com instalação simplificada e sessões colaborativas para agentes de IA
O que a demo da Nvidia mostrou na prática
A demo com Hermes Desktop, Ollama e PAIR registrou redução aproximada de 2x no tempo de conclusão ao combinar RTX Spark, DGX Spark e RTX 5090, contra um único laptop RTX Spark.
O Hermes dividiu a tarefa em cinco análises especialistas independentes. A NVIDIA alerta que a demo não é garantia de desempenho, pois os resultados dependem de paralelismo, modelo, engine, hardware, rede e disponibilidade dos nós.
O que o Pair não faz, segundo a própria Nvidia
A empresa deixa claro que o PAIR não une GPUs nem agrupa VRAM em um acelerador maior. O anúncio gerou confusão nas redes sociais, com usuários entendendo a ferramenta como forma de compartilhar computação com terceiros ou combinar hardware fraco para modelos complexos.
O usuário do Reddit Vegetable-Warthog81 relatou experiência positiva distribuindo inferência por três RTX 5090 rodando Qwen 3.8 27B via Ollama, priorizando estabilidade em tarefas repetitivas.
O que isso significa para quem desenvolve com IA local
Para quem precisa de compartilhamento de computação entre participantes de rede, o InfoQ indica Petals e Mesh LLM como alternativas, sendo que o Mesh LLM divide modelos grandes demais para uma única máquina com o recurso Skippy.
O PAIR está disponível para Windows 11, Linux e macOS, em arquiteturas x64 e arm64, podendo combinar nós com sistemas operacionais diferentes.
NVIDIA Personal AI Router está em beta e distribui inferência entre máquinas da rede local
Integração nativa com Ollama e LM Studio, sem mudanças na arquitetura do agente
Demo com Hermes Desktop registrou redução aproximada de 2x no tempo de conclusão
Compatível com Windows 11, Linux e macOS, em arquiteturas x64 e arm64
| Recurso | NVIDIA PAIR | Petals | Mesh LLM |
|---|---|---|---|
| Objetivo | Distribuir requisições de inferência entre nós locais | Compartilhar computação de GPU entre participantes de rede | Compartilhar computação e dividir modelos grandes |
| Integração local | Ollama e LM Studio | Não informado na fonte | Divisão de modelos via Skippy |
| Distribuição | NVIDIA, beta no GitHub | Comunidade open source | Comunidade open source |
Arraste para o lado para ver toda a tabela.
Leia também:
Fonte: Infoq