Escopo do projeto

O projeto entrega um assistente de perguntas e respostas embutido no canal escolhido (portal, intranet, Microsoft Teams, aplicativo ou sistema próprio), que responde com base num conjunto definido de documentos (normas, portarias, manuais, FAQs, procedimentos) e cita o trecho de origem em toda resposta. Roda inteiro na conta AWS da empresa: documentos num bucket Amazon S3 da conta (exportados do SharePoint, OneDrive, Google Drive ou Confluence por uma rotina de sincronização que o projeto monta), índice no Amazon Bedrock Knowledge Bases, modelo no Amazon Bedrock com Amazon Bedrock Guardrails no caminho de toda resposta, orquestração em AWS Lambda atrás de Amazon API Gateway, acesso central por IAM Identity Center e trilha no AWS CloudTrail, teto de custo verificado antes de cada chamada e limite de uso por origem. É o mesmo desenho do assistente do site da RFX.

Inclui as perguntas-critério, a PoC medida, a interface no canal, o aviso de IA, a saída para atendimento humano e a operação inicial. A redação e a revisão jurídica dos documentos ficam com a empresa; apontar documentos conflitantes ou desatualizados encontrados na PoC fica com a RFX.

Desafio e problemas de hoje

  • Cidadãos e servidores perdem tempo procurando a norma certa em PDFs; a mesma dúvida chega dezenas de vezes à ouvidoria, ao protocolo ou ao suporte.
  • Resposta varia conforme quem atende; ninguém cita a fonte.
  • Normas se sobrepõem (lei, decreto, portaria, instrução), com versões revogadas ainda circulando.
  • Público externo exige transparência: avisar que é IA, mostrar a fonte, ter caminho para uma pessoa.
  • Dado pessoal pode aparecer na pergunta (CPF, número de processo, nome); precisa ser mascarado antes de chegar ao modelo e ao log.
  • Custo de IA aberta ao público sem teto é risco de fatura.

O ambiente de partida (perfil típico deste exemplo)

Perfil típico do ambiente de partida deste exemplo
ItemO que costuma existir
DocumentosDe 200 a 5 mil normas, manuais e FAQs em PDF e Word; parte digitalizada sem OCR; versões revogadas misturadas
CanalPortal institucional (WordPress ou CMS próprio), intranet, Microsoft Teams, sistema de protocolo ou de suporte; às vezes WhatsApp (ver exemplo 4)
VolumeDe 500 a 20 mil perguntas por mês nos canais atuais
IdentidadeEntra ID ou Google para servidores; público externo anônimo ou com login gov.br ou do portal
Conta AWSInexistente ou uma conta sem acesso central; sem orçamento de IA
Dados pessoaisNas perguntas (CPF, processo, nome) e em alguns documentos (listas, atos com nome)
RestriçõesLGPD, transparência e isonomia (setor público), licitação, sigilo de processo; disponibilidade em horário comercial ou 24x7

Perfil típico, com faixas, construído a partir de projetos desse tipo. O inventário real é o primeiro entregável da descoberta.

Requisitos

  1. R1Toda resposta cita o trecho e o documento de origem; sem fonte, o assistente diz que não encontrou e aponta o canal humano.
  2. R2Documentos e índice ficam na conta AWS da empresa; os dados ficam fora do treinamento de modelos e fora do alcance do fornecedor do modelo.
  3. R3Dado pessoal na pergunta e na resposta é mascarado; temas fora do escopo são negados.
  4. R4Teto de custo verificado antes de cada chamada ao modelo e limite de uso por origem (IP ou usuário).
  5. R5Aviso de IA, saída para atendimento humano e registro das conversas com retenção curta e pseudonimização.
  6. R6Decisão de região e modelo registrada (São Paulo ou inferência global) antes da produção.
  7. R7Embutir no canal da empresa preservando o sistema atual (API própria, widget ou conector do Teams).

O que desenhamos para cada requisito

Decisão de arquitetura e serviço AWS para cada requisito
RequisitoDecisão de arquiteturaServiço AWS
R1Recuperação com citação (RAG) na Knowledge Base; instrução fixa no servidor "sem trecho de origem, responda que não encontrou e indique o canal humano"; revisão humana nas respostas que importamAmazon Bedrock Knowledge Bases, Amazon Bedrock
R2Documentos em Amazon S3 da conta (sincronizados do SharePoint, OneDrive, Google Drive ou Confluence por rotina do projeto); índice vetorial na conta; embeddings disponíveis em São Paulo (Amazon Titan Text Embeddings V2 ou Cohere Embed Multilingual)Amazon S3, Amazon Bedrock Knowledge Bases, Amazon OpenSearch Serverless
R3Guardrail com filtro de informação sensível (mascarar CPF, telefone, e-mail, nome quando aplicável), temas negados em português e filtro de conteúdo nocivo, aplicados na entrada e na saída (os dois no nível Standard, que em 06/10/2026 não é oferecido na região de São Paulo: o guardrail com esses dois filtros é criado numa região com Standard, ex.: Leste dos EUA, Norte da Virgínia, e aplicado de lá pela API ApplyGuardrail; em São Paulo o Guardrails tem só o nível Classic, sem português em temas negados e filtro de conteúdo)Amazon Bedrock Guardrails
R4Contador de gasto do dia e do mês lido antes de chamar o modelo (se passou do teto, resposta de indisponibilidade e canal humano); quota por origem com janela; alarme de orçamentoAWS Lambda, Amazon DynamoDB, AWS Budgets, Amazon CloudWatch
R5Aviso fixo na interface; botão "falar com uma pessoa" que abre o canal existente com o histórico; conversa gravada pseudonimizada com PII mascarada e TTLAmazon DynamoDB (TTL), Amazon Bedrock Guardrails
R6Em São Paulo, modelo processado na região (ex.: Mistral Large 3, DeepSeek V3.2, gpt-oss, Qwen3) ou Claude de última geração por inferência global, com documentos, índice e conversas em São Paulo; escolha registrada no inventário LGPD com o teste de qualidade da PoCAmazon Bedrock (perfis de inferência)
R7API própria atrás do API Gateway, com widget leve para o portal e, se for o caso, aplicativo no Microsoft Teams; IAM mínimo por função; acesso centralAmazon API Gateway, AWS Lambda, IAM Identity Center, AWS CloudTrail

Arquitetura

Arquitetura de referência de IA generativa dentro da conta da empresa na AWS. Os usuários enviam a pergunta ao Amazon API Gateway, que aciona o AWS Lambda na orquestração. O Lambda troca prompt e resposta com o Amazon Bedrock (modelos), filtrado pelo Amazon Bedrock Guardrails, e recebe contexto do Amazon Bedrock Knowledge Bases, que lê os documentos do Amazon S3 e grava os vetores no Amazon OpenSearch Serverless (índice vetorial). A resposta volta ao usuário pelo API Gateway. À direita, o grupo Governança e segurança reúne IAM Identity Center e AWS CloudTrail.
Seus dados ficam na sua conta: documentos e índice na conta da empresa; o modelo responde com esse contexto, passando por Guardrails; todo acesso é identificado e auditado. Modelos mais recentes podem processar a chamada em outra região AWS (inferência global). Abrir o diagrama em tela cheia
Componentes e fluxos deste diagrama
  • Usuários: canal ou sistema que envia a pergunta e recebe a resposta.
  • Amazon API Gateway: entrada da aplicação de IA.
  • AWS Lambda (orquestração, teto de custo e quota): monta o prompt, consulta o contexto e chama o modelo.
  • Amazon Bedrock (modelos): geração da resposta.
  • Amazon Bedrock Guardrails (filtros de entrada e saída): conteúdo, temas negados e dados pessoais.
  • Amazon S3 (documentos): fonte dos documentos da empresa.
  • Amazon Bedrock Knowledge Bases (busca com citação): ingestão dos documentos e recuperação do trecho de origem.
  • Amazon OpenSearch Serverless (índice vetorial).
  • IAM Identity Center (acesso) e AWS CloudTrail (registro de cada chamada).
  • Fluxos: pergunta e resposta entre os usuários e o API Gateway; prompt e resposta entre o Lambda e o Bedrock; filtros do Guardrails no Bedrock; contexto da Knowledge Base para o Lambda; documentos do S3 para a Knowledge Base; vetores da Knowledge Base para o OpenSearch Serverless.

Ganhos: o que medimos no projeto

Indicadores medidos no projeto, como são medidos e o que muda
IndicadorComo medimosO que muda
Acerto com citação nas perguntas-critérioVinte perguntas por conjunto, marcadas como acertou com fonte, errou, não encontrouA qualidade é número antes de abrir ao público
Dúvidas repetidas nos canais humanosContagem por semana na ouvidoria, no protocolo ou no suporte, por tema, antes e depoisFila humana fica com o que exige pessoa
Taxa de "não encontrei" e de transferência para humanoContadores do próprio assistenteMostra onde faltam documentos e onde a IA deve ceder a vez
Custo por conversa e gasto do dia contra o tetoMétricas do backend e AWS BudgetsA fatura é prevista, não descoberta
Intervenções do GuardrailContador por tipo (PII mascarada, tema negado)O que estava chegando ao modelo e não devia
Documentos conflitantes ou revogados encontradosLista produzida na PoCO projeto limpa a base de normas

Indicadores que a RFX mede na PoC e em produção. Os valores são da sua empresa; resultados de clientes ficam sob confidencialidade.

Escopo e entregáveis por fase

Fases do projeto, o que acontece, entregáveis e duração típica
FaseO que aconteceEntregáveisDuração
Fase 0: diagnóstico curtoConjunto de documentos, público (interno, externo), canal, vinte perguntas com resposta esperada, decisão de região e modelo candidata, teto de custo, critério de sucesso escrito (ex.: "16 de 20 perguntas com citação correta; nenhuma resposta com dado pessoal exposto; custo por conversa dentro do teto; em 4 semanas")Ficha do caso; critério assinado; inventário de fontes1 semana
Fase 1: PoC com critério de sucesso escritoBucket S3, Knowledge Base e Guardrail no console; teste no próprio console antes de escrever código; API mínima; medição das vinte perguntas com dois modelos (um na região, um por inferência global); relatórioBase e guardrail; relatório comparativo; lista de documentos a corrigirDe 3 a 4 semanas
Fase 2: produçãoInterface no canal; teto de custo e quota; aviso de IA e saída para humano; conversa pseudonimizada com TTL; IAM mínimo, acesso central, CloudTrail; registro LGPD; runbook e alarmesAssistente no ar; runbook; política de uso; registro de tratamentoDe 6 a 10 semanas no total (oferta)
Fase 3: operaçãoRevisão semanal de "não encontrei"; atualização de documentos; revisão de custo mês a mês; auditoria por amostragem das respostas; transferência ao time da empresa com operação assistidaRotina de operação documentadaContínua

Durações típicas, em faixa. O plano do projeto fixa as datas reais.

Algo a mais: uma base, dois públicos

A mesma base responde no Microsoft Teams para o servidor e no portal para o cidadão, com guardrails diferentes por público. Para o setor público, a RFX acrescenta um relatório mensal de perguntas mais frequentes por tema, que vira insumo para melhorar a página de transparência e as FAQs oficiais, e reduz o que precisa passar pela IA.

Cuidados: LGPD, região e revisão humana

  • Região: em 06/10/2026, São Paulo tem modelos processados na região (entre eles o gpt-oss, de pesos abertos); Claude de última geração e GPT-5.6 (Sol, Terra e Luna) da OpenAI só por inferência global, processados fora da região. Documentos, índice e conversas ficam em São Paulo. A escolha entra no registro de tratamento e, para órgãos públicos, na análise do encarregado.
  • Retenção para detecção de abuso: em 06/10/2026, segundo a documentação do Amazon Bedrock, o Claude Fable 5.1 retém todo o tráfego por até 30 dias, com a conta configurada no modo aws_review, em que o conteúdo sinalizado pode ser revisado por pessoas da AWS; o GPT-5.6 (Sol, Terra e Luna) retém só o tráfego sinalizado, por até 30 dias. A cópia retida fica na região onde a chamada foi processada e não é compartilhada com o provedor do modelo. O Claude Fable 5.1 exige ativar o modo aws_review na conta antes do uso. Documente por modelo no registro de tratamento.
  • A verificação automática de alucinação do Guardrails (contextual grounding) cobre outros idiomas, e ainda deixa o português de fora em 06/10/2026. Mantenha citação da fonte em toda resposta e revisão humana por amostragem; a qualidade é medida na PoC e auditada em produção.
  • Temas negados e filtro de conteúdo em português só existem no nível Standard do Guardrails, que em 06/10/2026 não é oferecido na região de São Paulo: o guardrail com esses filtros é criado numa região com Standard (ex.: Leste dos EUA, Norte da Virgínia) e aplicado de lá pela API ApplyGuardrail, e essa saída da região entra no registro de tratamento. O filtro de informação sensível tem português suportado em qualquer nível e em qualquer região onde o Guardrails é oferecido, São Paulo incluída.
  • Público externo: aviso de IA visível, fonte clicável, saída para pessoa; decisão sobre direito ou benefício sempre com uma pessoa.
  • Para projeto novo, o caminho é Amazon Bedrock Knowledge Bases; o Amazon Kendra não aceita novos clientes (aviso oficial da AWS) e fica fora da recomendação.
  • Segredos, chaves e dado pessoal cru ficam fora de prompt e de arquivo de contexto.

Perguntas frequentes deste exemplo

O Quick é aplicação pronta para uso interno, por configuração. Este exemplo embute a resposta no seu canal ou sistema, atende público externo e dá controle total de guardrail, custo e auditoria na sua conta; exige desenvolvimento (ou a RFX).

Pode, como qualquer sistema. Por isso toda resposta cita a fonte, o assistente diz "não encontrei" quando não há trecho, há aviso de IA e caminho para uma pessoa, e a taxa de erro é medida na PoC e auditada por amostragem em produção. Decisão sobre direito ou benefício é sempre de uma pessoa.

Em 06/10/2026, os modelos Claude mais recentes só estão disponíveis a partir de São Paulo por inferência global, processada em outra região AWS; documentos, índice e conversas continuam em São Paulo; o que o modelo retém para detecção de abuso fica na região de processamento. Se o requisito for processamento na região, há modelos abertos e Mistral rodando em São Paulo. A PoC compara os dois caminhos.

Depende do volume de perguntas e do modelo. O diagnóstico estima com três cenários, e a produção tem teto diário verificado antes de cada chamada: passou do teto, o assistente avisa e manda para o canal humano.

Sim, o mesmo desenho: Amazon Bedrock com Guardrails no caminho de toda resposta, gasto verificado antes de cada chamada e limite por origem. A metodologia está publicada no site.

Serviços AWS deste exemplo

  • Amazon Bedrock
  • Amazon Bedrock Knowledge Bases
  • Amazon Bedrock Guardrails
  • Amazon S3
  • Amazon OpenSearch Serverless
  • AWS Lambda
  • Amazon API Gateway
  • Amazon DynamoDB
  • AWS Budgets
  • Amazon CloudWatch
  • IAM Identity Center
  • AWS CloudTrail

Incentivos AWS

A RFX busca para o projeto os programas de incentivo, créditos e verbas de PoC da AWS e da distribuição aplicáveis, sempre sujeitos a aprovação da AWS e da distribuição.

Agende uma conversa com um especialista

Conte em uma linha o processo que dói e o que você tem hoje (documentos, sistema, canal). Um engenheiro da RFX responde com o próximo passo e, se fizer sentido, o desenho de uma PoC com critério de sucesso escrito. Incentivos, créditos e verbas de PoC da AWS e da distribuição são buscados para o projeto, sempre sujeitos a aprovação da AWS e da distribuição.

Ver cases reais da RFX (anonimizados por confidencialidade)

O que quer resolver primeiro? (opcional)
Já usa AWS? (opcional)

Quem responde é um engenheiro da RFX, AWS Partner Advanced Tier, em até 4 horas úteis. Seus dados são usados para responder a este contato, conforme a Política de Privacidade.

Casos relacionados

Falar com um engenheiro