Respostas com fontes em 300 milissegundos.
Busca híbrida, semântica e por palavra-chave, em milhões de chunks. Feita para streaming. Rápida o bastante para agentes de voz e chat ao vivo.
Seus dados viram respostas na hora, na nuvem, prontas para qualquer agente ou app de IA usar.
Três motivos. A stack inteira é em Rust, então não tem overhead de Python. A inferência roda na Cerebras e na Groq, os hosts de LLM mais rápidos do mundo.
E busca, rerank e citações rodam em paralelo. Resultado: respostas com fontes em 300 ms, com rerank ligado por padrão.
As respostas vêm dos seus documentos. Confira antes de decisões importantes.
Do upload do documento à resposta com fontes. Tudo o que hoje você teria que montar juntando cinco serviços diferentes.
Busca híbrida, semântica e por palavra-chave, em milhões de chunks. Feita para streaming. Rápida o bastante para agentes de voz e chat ao vivo.
Upload, Google Drive, OneDrive, SharePoint e rastreamento de sites. Atualiza sozinho quando o documento muda. OCR para digitalizações, leitura de layout para PDFs e tabelas.
Organize os documentos em coleções. Compartilhe com um colega ou com a empresa toda. Acesso por função. Revogue com um clique.
SDKs em TypeScript e Python. Servidor MCP nativo para agentes. E uma API REST limpa, que qualquer coisa que fale HTTP consegue chamar.
// instalar: npm i @rustyrag/node import { RustyRAG } from "@rustyrag/node"; const rag = new RustyRAG({ apiKey: process.env.RR_KEY }); const out = await rag.answer({ query: "refund policy?" });
# instalar: pip install rustyrag from rustyrag import RustyRAG rag = RustyRAG(api_key=os.environ["RR_KEY"]) out = rag.answer(query="refund policy?")
// claude_desktop_config.json — cole em qualquer host MCP { "mcpServers": { "rustyrag": { "command": "npx", "args": ["-y", "@rustyrag/mcp"], "env": { "RR_KEY": "<your_key>" } } } }
# OpenClaw: REST, curl, qualquer coisa HTTP curl https://api.rustyrag.ai/v1/answer \ -H "Authorization: Bearer $RR_KEY" \ -H "Content-Type: application/json" \ -d '{"query":"refund policy?"}'
Uso por workspace. Custo atribuído a quem consumiu. Replay de consultas para depurar e auditar.
Envie um documento. Chame a API. Receba a resposta com fontes em streaming. Sem infraestrutura para cuidar. Sem pipeline de busca para ajustar.
// Respostas com fontes, em tempo real, dos seus docs import { RustyRAG } from "rustyrag"; const client = new RustyRAG({ apiKey: process.env.RR_KEY }); // Envie uma vez const up = await client.upload("policy.pdf"); await client.waitForUpload(up.task_id); // Receba a resposta com fontes em streaming const stream = await client.answer("refund policy?", { stream: true }); for await (const c of stream) process.stdout.write(c.text); // → 150ms TTFT · 300ms total · com fontes
Parsers para PDF, digitalização, tabela, formulário, código e web. Chunking que respeita o layout. Todos os metadados preservados.
Vetores para o sentido. BM25 para o termo exato. Atualização automática, isolamento por tenant, criptografia em repouso.
Recall híbrido. Rerank com cross-encoder. Sem duplicata e com fonte. Em streaming, abaixo de 300 ms no p50.


Cobramos pelo uso e montamos um plano que cabe no seu caso — nada de faixa engessada. Marque uma conversa de 20 minutos e a gente coloca o RustyRAG rodando nos seus documentos.
Implantação no seu ambiente, infraestrutura dedicada, SLA personalizado, revisão de segurança, migração acompanhada de perto.
A gente resolve o pipeline inteiro. Ingestão, parsing, busca híbrida, rerank, citações e observabilidade, tudo em uma API. Você pula a costura de cinco serviços e gasta o tempo lançando funcionalidade, não encanamento.
Criptografados em repouso e em trânsito. Cada cliente tem um índice isolado. No plano Enterprise, o RustyRAG roda na sua própria infraestrutura. Nunca treinamos modelos com os seus dados.
A inferência roda na Groq e na Cerebras, os dois hosts de LLM mais rápidos do planeta. Os dois servem vários modelos abertos, como Llama, Qwen, GPT-OSS e Mixtral. Você escolhe qual usar a cada requisição. E com suporte nativo a MCP, qualquer agente compatível chama o RustyRAG direto.
Serve. p50 abaixo de 300 ms, p95 abaixo de 600 ms. A API nasceu para streaming, voz e chat ao vivo. Agente de voz é um dos casos que mais otimizamos.
O limite é flexível. Avisamos bem antes de você chegar lá. O excedente é cobrado por unidade, com preço claro. Nada de surpresa na fatura.
Dá. Temos ferramentas de migração para os principais. Nos planos Business e Enterprise, a migração é acompanhada de perto pelo nosso time.
Pronto para produção em uma tarde. Marque uma conversa de 20 minutos e a gente coloca o RustyRAG rodando nos seus documentos.