Escopo do projeto
O projeto entrega um assistente de perguntas e respostas embutido no canal escolhido (portal, intranet, Microsoft Teams, aplicativo ou sistema próprio), que responde com base num conjunto definido de documentos (normas, portarias, manuais, FAQs, procedimentos) e cita o trecho de origem em toda resposta. Roda inteiro na conta AWS da empresa: documentos num bucket Amazon S3 da conta (exportados do SharePoint, OneDrive, Google Drive ou Confluence por uma rotina de sincronização que o projeto monta), índice no Amazon Bedrock Knowledge Bases, modelo no Amazon Bedrock com Amazon Bedrock Guardrails no caminho de toda resposta, orquestração em AWS Lambda atrás de Amazon API Gateway, acesso central por IAM Identity Center e trilha no AWS CloudTrail, teto de custo verificado antes de cada chamada e limite de uso por origem. É o mesmo desenho do assistente do site da RFX.
Inclui as perguntas-critério, a PoC medida, a interface no canal, o aviso de IA, a saída para atendimento humano e a operação inicial. A redação e a revisão jurídica dos documentos ficam com a empresa; apontar documentos conflitantes ou desatualizados encontrados na PoC fica com a RFX.
Desafio e problemas de hoje
- Cidadãos e servidores perdem tempo procurando a norma certa em PDFs; a mesma dúvida chega dezenas de vezes à ouvidoria, ao protocolo ou ao suporte.
- Resposta varia conforme quem atende; ninguém cita a fonte.
- Normas se sobrepõem (lei, decreto, portaria, instrução), com versões revogadas ainda circulando.
- Público externo exige transparência: avisar que é IA, mostrar a fonte, ter caminho para uma pessoa.
- Dado pessoal pode aparecer na pergunta (CPF, número de processo, nome); precisa ser mascarado antes de chegar ao modelo e ao log.
- Custo de IA aberta ao público sem teto é risco de fatura.
O ambiente de partida (perfil típico deste exemplo)
| Item | O que costuma existir |
|---|---|
| Documentos | De 200 a 5 mil normas, manuais e FAQs em PDF e Word; parte digitalizada sem OCR; versões revogadas misturadas |
| Canal | Portal institucional (WordPress ou CMS próprio), intranet, Microsoft Teams, sistema de protocolo ou de suporte; às vezes WhatsApp (ver exemplo 4) |
| Volume | De 500 a 20 mil perguntas por mês nos canais atuais |
| Identidade | Entra ID ou Google para servidores; público externo anônimo ou com login gov.br ou do portal |
| Conta AWS | Inexistente ou uma conta sem acesso central; sem orçamento de IA |
| Dados pessoais | Nas perguntas (CPF, processo, nome) e em alguns documentos (listas, atos com nome) |
| Restrições | LGPD, transparência e isonomia (setor público), licitação, sigilo de processo; disponibilidade em horário comercial ou 24x7 |
Perfil típico, com faixas, construído a partir de projetos desse tipo. O inventário real é o primeiro entregável da descoberta.
Requisitos
- R1Toda resposta cita o trecho e o documento de origem; sem fonte, o assistente diz que não encontrou e aponta o canal humano.
- R2Documentos e índice ficam na conta AWS da empresa; os dados ficam fora do treinamento de modelos e fora do alcance do fornecedor do modelo.
- R3Dado pessoal na pergunta e na resposta é mascarado; temas fora do escopo são negados.
- R4Teto de custo verificado antes de cada chamada ao modelo e limite de uso por origem (IP ou usuário).
- R5Aviso de IA, saída para atendimento humano e registro das conversas com retenção curta e pseudonimização.
- R6Decisão de região e modelo registrada (São Paulo ou inferência global) antes da produção.
- R7Embutir no canal da empresa preservando o sistema atual (API própria, widget ou conector do Teams).
O que desenhamos para cada requisito
| Requisito | Decisão de arquitetura | Serviço AWS |
|---|---|---|
| R1 | Recuperação com citação (RAG) na Knowledge Base; instrução fixa no servidor "sem trecho de origem, responda que não encontrou e indique o canal humano"; revisão humana nas respostas que importam | Amazon Bedrock Knowledge Bases, Amazon Bedrock |
| R2 | Documentos em Amazon S3 da conta (sincronizados do SharePoint, OneDrive, Google Drive ou Confluence por rotina do projeto); índice vetorial na conta; embeddings disponíveis em São Paulo (Amazon Titan Text Embeddings V2 ou Cohere Embed Multilingual) | Amazon S3, Amazon Bedrock Knowledge Bases, Amazon OpenSearch Serverless |
| R3 | Guardrail com filtro de informação sensível (mascarar CPF, telefone, e-mail, nome quando aplicável), temas negados em português e filtro de conteúdo nocivo, aplicados na entrada e na saída (os dois no nível Standard, que em 06/10/2026 não é oferecido na região de São Paulo: o guardrail com esses dois filtros é criado numa região com Standard, ex.: Leste dos EUA, Norte da Virgínia, e aplicado de lá pela API ApplyGuardrail; em São Paulo o Guardrails tem só o nível Classic, sem português em temas negados e filtro de conteúdo) | Amazon Bedrock Guardrails |
| R4 | Contador de gasto do dia e do mês lido antes de chamar o modelo (se passou do teto, resposta de indisponibilidade e canal humano); quota por origem com janela; alarme de orçamento | AWS Lambda, Amazon DynamoDB, AWS Budgets, Amazon CloudWatch |
| R5 | Aviso fixo na interface; botão "falar com uma pessoa" que abre o canal existente com o histórico; conversa gravada pseudonimizada com PII mascarada e TTL | Amazon DynamoDB (TTL), Amazon Bedrock Guardrails |
| R6 | Em São Paulo, modelo processado na região (ex.: Mistral Large 3, DeepSeek V3.2, gpt-oss, Qwen3) ou Claude de última geração por inferência global, com documentos, índice e conversas em São Paulo; escolha registrada no inventário LGPD com o teste de qualidade da PoC | Amazon Bedrock (perfis de inferência) |
| R7 | API própria atrás do API Gateway, com widget leve para o portal e, se for o caso, aplicativo no Microsoft Teams; IAM mínimo por função; acesso central | Amazon API Gateway, AWS Lambda, IAM Identity Center, AWS CloudTrail |
Arquitetura
Componentes e fluxos deste diagrama
- Usuários: canal ou sistema que envia a pergunta e recebe a resposta.
- Amazon API Gateway: entrada da aplicação de IA.
- AWS Lambda (orquestração, teto de custo e quota): monta o prompt, consulta o contexto e chama o modelo.
- Amazon Bedrock (modelos): geração da resposta.
- Amazon Bedrock Guardrails (filtros de entrada e saída): conteúdo, temas negados e dados pessoais.
- Amazon S3 (documentos): fonte dos documentos da empresa.
- Amazon Bedrock Knowledge Bases (busca com citação): ingestão dos documentos e recuperação do trecho de origem.
- Amazon OpenSearch Serverless (índice vetorial).
- IAM Identity Center (acesso) e AWS CloudTrail (registro de cada chamada).
- Fluxos: pergunta e resposta entre os usuários e o API Gateway; prompt e resposta entre o Lambda e o Bedrock; filtros do Guardrails no Bedrock; contexto da Knowledge Base para o Lambda; documentos do S3 para a Knowledge Base; vetores da Knowledge Base para o OpenSearch Serverless.
Ganhos: o que medimos no projeto
| Indicador | Como medimos | O que muda |
|---|---|---|
| Acerto com citação nas perguntas-critério | Vinte perguntas por conjunto, marcadas como acertou com fonte, errou, não encontrou | A qualidade é número antes de abrir ao público |
| Dúvidas repetidas nos canais humanos | Contagem por semana na ouvidoria, no protocolo ou no suporte, por tema, antes e depois | Fila humana fica com o que exige pessoa |
| Taxa de "não encontrei" e de transferência para humano | Contadores do próprio assistente | Mostra onde faltam documentos e onde a IA deve ceder a vez |
| Custo por conversa e gasto do dia contra o teto | Métricas do backend e AWS Budgets | A fatura é prevista, não descoberta |
| Intervenções do Guardrail | Contador por tipo (PII mascarada, tema negado) | O que estava chegando ao modelo e não devia |
| Documentos conflitantes ou revogados encontrados | Lista produzida na PoC | O projeto limpa a base de normas |
Indicadores que a RFX mede na PoC e em produção. Os valores são da sua empresa; resultados de clientes ficam sob confidencialidade.
Escopo e entregáveis por fase
| Fase | O que acontece | Entregáveis | Duração |
|---|---|---|---|
| Fase 0: diagnóstico curto | Conjunto de documentos, público (interno, externo), canal, vinte perguntas com resposta esperada, decisão de região e modelo candidata, teto de custo, critério de sucesso escrito (ex.: "16 de 20 perguntas com citação correta; nenhuma resposta com dado pessoal exposto; custo por conversa dentro do teto; em 4 semanas") | Ficha do caso; critério assinado; inventário de fontes | 1 semana |
| Fase 1: PoC com critério de sucesso escrito | Bucket S3, Knowledge Base e Guardrail no console; teste no próprio console antes de escrever código; API mínima; medição das vinte perguntas com dois modelos (um na região, um por inferência global); relatório | Base e guardrail; relatório comparativo; lista de documentos a corrigir | De 3 a 4 semanas |
| Fase 2: produção | Interface no canal; teto de custo e quota; aviso de IA e saída para humano; conversa pseudonimizada com TTL; IAM mínimo, acesso central, CloudTrail; registro LGPD; runbook e alarmes | Assistente no ar; runbook; política de uso; registro de tratamento | De 6 a 10 semanas no total (oferta) |
| Fase 3: operação | Revisão semanal de "não encontrei"; atualização de documentos; revisão de custo mês a mês; auditoria por amostragem das respostas; transferência ao time da empresa com operação assistida | Rotina de operação documentada | Contínua |
Durações típicas, em faixa. O plano do projeto fixa as datas reais.
Algo a mais: uma base, dois públicos
A mesma base responde no Microsoft Teams para o servidor e no portal para o cidadão, com guardrails diferentes por público. Para o setor público, a RFX acrescenta um relatório mensal de perguntas mais frequentes por tema, que vira insumo para melhorar a página de transparência e as FAQs oficiais, e reduz o que precisa passar pela IA.
Cuidados: LGPD, região e revisão humana
- Região: em 06/10/2026, São Paulo tem modelos processados na região (entre eles o gpt-oss, de pesos abertos); Claude de última geração e GPT-5.6 (Sol, Terra e Luna) da OpenAI só por inferência global, processados fora da região. Documentos, índice e conversas ficam em São Paulo. A escolha entra no registro de tratamento e, para órgãos públicos, na análise do encarregado.
- Retenção para detecção de abuso: em 06/10/2026, segundo a documentação do Amazon Bedrock, o Claude Fable 5.1 retém todo o tráfego por até 30 dias, com a conta configurada no modo aws_review, em que o conteúdo sinalizado pode ser revisado por pessoas da AWS; o GPT-5.6 (Sol, Terra e Luna) retém só o tráfego sinalizado, por até 30 dias. A cópia retida fica na região onde a chamada foi processada e não é compartilhada com o provedor do modelo. O Claude Fable 5.1 exige ativar o modo aws_review na conta antes do uso. Documente por modelo no registro de tratamento.
- A verificação automática de alucinação do Guardrails (contextual grounding) cobre outros idiomas, e ainda deixa o português de fora em 06/10/2026. Mantenha citação da fonte em toda resposta e revisão humana por amostragem; a qualidade é medida na PoC e auditada em produção.
- Temas negados e filtro de conteúdo em português só existem no nível Standard do Guardrails, que em 06/10/2026 não é oferecido na região de São Paulo: o guardrail com esses filtros é criado numa região com Standard (ex.: Leste dos EUA, Norte da Virgínia) e aplicado de lá pela API ApplyGuardrail, e essa saída da região entra no registro de tratamento. O filtro de informação sensível tem português suportado em qualquer nível e em qualquer região onde o Guardrails é oferecido, São Paulo incluída.
- Público externo: aviso de IA visível, fonte clicável, saída para pessoa; decisão sobre direito ou benefício sempre com uma pessoa.
- Para projeto novo, o caminho é Amazon Bedrock Knowledge Bases; o Amazon Kendra não aceita novos clientes (aviso oficial da AWS) e fica fora da recomendação.
- Segredos, chaves e dado pessoal cru ficam fora de prompt e de arquivo de contexto.
Perguntas frequentes deste exemplo
O Quick é aplicação pronta para uso interno, por configuração. Este exemplo embute a resposta no seu canal ou sistema, atende público externo e dá controle total de guardrail, custo e auditoria na sua conta; exige desenvolvimento (ou a RFX).
Pode, como qualquer sistema. Por isso toda resposta cita a fonte, o assistente diz "não encontrei" quando não há trecho, há aviso de IA e caminho para uma pessoa, e a taxa de erro é medida na PoC e auditada por amostragem em produção. Decisão sobre direito ou benefício é sempre de uma pessoa.
Em 06/10/2026, os modelos Claude mais recentes só estão disponíveis a partir de São Paulo por inferência global, processada em outra região AWS; documentos, índice e conversas continuam em São Paulo; o que o modelo retém para detecção de abuso fica na região de processamento. Se o requisito for processamento na região, há modelos abertos e Mistral rodando em São Paulo. A PoC compara os dois caminhos.
Depende do volume de perguntas e do modelo. O diagnóstico estima com três cenários, e a produção tem teto diário verificado antes de cada chamada: passou do teto, o assistente avisa e manda para o canal humano.
Sim, o mesmo desenho: Amazon Bedrock com Guardrails no caminho de toda resposta, gasto verificado antes de cada chamada e limite por origem. A metodologia está publicada no site.
Serviços AWS deste exemplo
- Amazon Bedrock
- Amazon Bedrock Knowledge Bases
- Amazon Bedrock Guardrails
- Amazon S3
- Amazon OpenSearch Serverless
- AWS Lambda
- Amazon API Gateway
- Amazon DynamoDB
- AWS Budgets
- Amazon CloudWatch
- IAM Identity Center
- AWS CloudTrail
Incentivos AWS
A RFX busca para o projeto os programas de incentivo, créditos e verbas de PoC da AWS e da distribuição aplicáveis, sempre sujeitos a aprovação da AWS e da distribuição.