A API de RAG mais rápida · com fontes · streaming · rerank por padrão

Contexto em tempo real
para agentes e apps de IA.

Seus dados viram respostas na hora, na nuvem, prontas para qualquer agente ou app de IA usar.

Feito para produção▲ Rust◇ Milvus⊡ Cerebras✦ Groq○ Jina AI
Busca0ms
TTFT0ms
Latência p500ms
Latência p950ms
IntegraçãoTS · PY · MCP · REST
Traga seus dados de
Google DriveGmailOneDriveSharePointOutlookSlackNotionGitHubJiraConfluenceSalesforceServiceNow
@alex
Por que o RustyRAG é tão rápido?

Três motivos. A stack inteira é em Rust, então não tem overhead de Python. A inferência roda na Cerebras e na Groq, os hosts de LLM mais rápidos do mundo.

E busca, rerank e citações rodam em paralelo. Resultado: respostas com fontes em 300 ms, com rerank ligado por padrão.

150ms ttft · 300ms total
Pergunte qualquer coisa sobre seus documentos…
Webcerebras⏎ enviar

As respostas vêm dos seus documentos. Confira antes de decisões importantes.

Recursos · 01 a 05

As cinco camadas de um RAG de produção.
Em uma plataforma só.

Do upload do documento à resposta com fontes. Tudo o que hoje você teria que montar juntando cinco serviços diferentes.

01Busca em tempo real

Respostas com fontes em 300 milissegundos.

Busca híbrida, semântica e por palavra-chave, em milhões de chunks. Feita para streaming. Rápida o bastante para agentes de voz e chat ao vivo.

RustyRAG
300 ms
Fornecedor A
920 ms
Fornecedor B
1.34 s
02Conectores e ingestão

Traga qualquer fonte. Até tabelas, digitalizações e aquele arquivo bagunçado.

Upload, Google Drive, OneDrive, SharePoint e rastreamento de sites. Atualiza sozinho quando o documento muda. OCR para digitalizações, leitura de layout para PDFs e tabelas.

PDF
DOCX
GDrive
OneDrive
SharePoint
Web
Upload
Mais
03Coleções compartilhadas

Coleções compartilhadas com o time inteiro.

Organize os documentos em coleções. Compartilhe com um colega ou com a empresa toda. Acesso por função. Revogue com um clique.

legal-q42.418 páginas · acme-prod
compartilhada
EWJDRT+12
3 editores · 12 leitores
04Integração

Uma API. Quatro portas de entrada.

SDKs em TypeScript e Python. Servidor MCP nativo para agentes. E uma API REST limpa, que qualquer coisa que fale HTTP consegue chamar.

// instalar: npm i @rustyrag/node
import { RustyRAG } from "@rustyrag/node";

const rag = new RustyRAG({ apiKey: process.env.RR_KEY });
const out = await rag.answer({ query: "refund policy?" });
# instalar: pip install rustyrag
from rustyrag import RustyRAG

rag = RustyRAG(api_key=os.environ["RR_KEY"])
out = rag.answer(query="refund policy?")
// claude_desktop_config.json — cole em qualquer host MCP
{
  "mcpServers": {
    "rustyrag": {
      "command": "npx",
      "args": ["-y", "@rustyrag/mcp"],
      "env": { "RR_KEY": "<your_key>" }
    }
  }
}
# OpenClaw: REST, curl, qualquer coisa HTTP
curl https://api.rustyrag.ai/v1/answer \
  -H "Authorization: Bearer $RR_KEY" \
  -H "Content-Type: application/json" \
  -d '{"query":"refund policy?"}'
05Observabilidade

Rastreie cada consulta. Audite cada resposta.

Uso por workspace. Custo atribuído a quem consumiu. Replay de consultas para depurar e auditar.

Consultas / min
12,408
+18,4% · 24h
Hit @ 5
94.2%
+2,1pp
Integração · em menos de 10 minutos

Se o seu time sabe chamar uma API, dá para colocar isso no ar hoje.

Envie um documento. Chame a API. Receba a resposta com fontes em streaming. Sem infraestrutura para cuidar. Sem pipeline de busca para ajustar.

01
Pegue uma chave de API. Leva segundos.
02
Envie seus documentos. Upload, Google Drive, OneDrive, SharePoint ou o rastreamento do seu site.
03
Faça perguntas. Receba respostas com fontes no seu app, agente ou fluxo.
agent.tstypescript
// Respostas com fontes, em tempo real, dos seus docs
import { RustyRAG } from "rustyrag";

const client = new RustyRAG({ apiKey: process.env.RR_KEY });

// Envie uma vez
const up = await client.upload("policy.pdf");
await client.waitForUpload(up.task_id);

// Receba a resposta com fontes em streaming
const stream = await client.answer("refund policy?", { stream: true });

for await (const c of stream) process.stdout.write(c.text);

// → 150ms TTFT · 300ms total · com fontes
Arquitetura

Do documento bruto à resposta com fontes.
Em três etapas.

Etapa 01Ingestão

Lê tudo.
Não perde nada.

Parsers para PDF, digitalização, tabela, formulário, código e web. Chunking que respeita o layout. Todos os metadados preservados.

PDF
chunk_01
chunk_02
chunk_03
chunk_04
indexado
Etapa 02Índice

Índice híbrido.
Denso e lexical.

Vetores para o sentido. BM25 para o termo exato. Atualização automática, isolamento por tenant, criptografia em repouso.

espaço vetorial
dense1536d · cosseno
bm25esparso · palavra-chave
metadatafiltrável
aclisolado por tenant
Etapa 03Busca

Responde em streaming.
Cita a fonte.

Recall híbrido. Rerank com cross-encoder. Sem duplicata e com fonte. Em streaming, abaixo de 300 ms no p50.

consulta
recalltop 50
rerankcross-encoder
citar + streamingSSE
Time · os fundadores

Feito por quem coloca a mão na massa.
E roda em produção.

Ignas Vaitukaitis

Ignas Vaitukaitis

Fundador e CEO

8 anos desenvolvendo software corporativo, os últimos 4 dedicados a agentes de IA e aplicações RAG. Mais de 20 projetos em produção para grandes empresas. Lituano, vive no Rio de Janeiro.

Miguel de Frias

Miguel de Frias

Fundador e CTO

4 anos criando soluções de IA para clientes na América Latina, nos EUA e na Europa, com foco em sistemas agênticos e RAG. Engenheiro de Software pela Universidade de Brasília, hoje no mestrado em Ciência da Computação. Vive em Brasília.

Benchmarks · interno · 10 mil docs

Mais rápido que qualquer coisa que dê para montar por conta própria.

Busca de ponta a ponta. Corpus de 10 mil documentos.

Benchmark interno com documentos financeiros, jurídicos e do PubMed. Quanto menor, mais rápido. Quanto menor, mais barato.

RustyRAGFornecedor AFornecedor BPrópria (pgvector + LLM)
Latência p50
RustyRAG
300 ms
Fornecedor A
680 ms
Fornecedor B
940 ms
Própria
1.25 s
Custo / 1 mil consultas
RustyRAG
$0.18
Fornecedor A
$0.46
Fornecedor B
$0.59
Própria
$0.80
Preços · por uso

Um preço que cresce junto com você.
Pensado para o jeito que você usa de verdade.

Conta pra gente o que você está construindo

Cobramos pelo uso e montamos um plano que cabe no seu caso — nada de faixa engessada. Marque uma conversa de 20 minutos e a gente coloca o RustyRAG rodando nos seus documentos.

Agendar demo
Em todos os planos
  • Busca ilimitada
  • SLA de 99,9% de disponibilidade
  • Busca híbrida e rerank
  • Busca na web em menos de 100ms — não é uma chamada ao Google
  • Streaming com citações
  • MCP, REST e SDKs
  • Todos os conectores

Enterprise · sob medida

Implantação no seu ambiente, infraestrutura dedicada, SLA personalizado, revisão de segurança, migração acompanhada de perto.

Falar com vendas
FAQ · as mais comuns

Suas dúvidas, respondidas.

A gente resolve o pipeline inteiro. Ingestão, parsing, busca híbrida, rerank, citações e observabilidade, tudo em uma API. Você pula a costura de cinco serviços e gasta o tempo lançando funcionalidade, não encanamento.

Criptografados em repouso e em trânsito. Cada cliente tem um índice isolado. No plano Enterprise, o RustyRAG roda na sua própria infraestrutura. Nunca treinamos modelos com os seus dados.

A inferência roda na Groq e na Cerebras, os dois hosts de LLM mais rápidos do planeta. Os dois servem vários modelos abertos, como Llama, Qwen, GPT-OSS e Mixtral. Você escolhe qual usar a cada requisição. E com suporte nativo a MCP, qualquer agente compatível chama o RustyRAG direto.

Serve. p50 abaixo de 300 ms, p95 abaixo de 600 ms. A API nasceu para streaming, voz e chat ao vivo. Agente de voz é um dos casos que mais otimizamos.

O limite é flexível. Avisamos bem antes de você chegar lá. O excedente é cobrado por unidade, com preço claro. Nada de surpresa na fatura.

Dá. Temos ferramentas de migração para os principais. Nos planos Business e Enterprise, a migração é acompanhada de perto pelo nosso time.

Coloque no ar a funcionalidade de IA do seu roadmap.
Ainda neste trimestre.

Pronto para produção em uma tarde. Marque uma conversa de 20 minutos e a gente coloca o RustyRAG rodando nos seus documentos.

Agendar demo