Avaliação de Qualidade e Fundamentação de Sistemas RAG (Pesquisa com Desenvolvedores)
Avalia as experiências de desenvolvedores com sistemas de Retrieval-Augmented Generation em relação à qualidade de recuperação, precisão de fundamentação, práticas de avaliação e infraestrutura. Elaborada para engenheiros de ML, engenheiros de backend e cientistas de dados que estejam ativamente construindo ou mantendo pipelines de RAG.
Perguntas de exemplo
Uma prévia do que há no modelo. Todas as perguntas podem ser editadas antes de publicar.
Você construiu ou manteve um sistema RAG nos últimos 6 meses?
- Sim
- Não
- Não tenho certeza
Qual função melhor descreve seu trabalho no dia a dia?
- Engenheiro de ML
- Engenheiro de backend
- Cientista de dados
- MLOps/Plataforma
- Engenheiro de produto
- Pesquisador
- Arquiteto/Líder técnico
- Outro
Quais fontes de conteúdo alimentam seu recuperador atualmente? Selecione todas as que se aplicam.
- Documentos proprietários
- Repositórios de código
- Base de conhecimento do produto
- Rastreamento web
- Documentação de API de fornecedores
- Logs do Slack/Chat
- Tickets de suporte
- Wiki/Confluence
- Banco de dados/data warehouse
- Não se aplica
- Outro
Como as respostas do modelo são fundamentadas ou citadas em seu sistema RAG? Selecione todas as que se aplicam.
- Citações inline com URLs
- Citações inline com IDs de documentos
- Bloco de evidências após a resposta
- Saídas de ferramentas incluídas na íntegra
- Lista estruturada de evidências em JSON
- Sem fundamentação/citações
- Outro
Quais ferramentas ou bibliotecas de avaliação você usa para RAG? Selecione todas as que se aplicam.
- Ragas
- TruLens
- DeepEval
- Promptfoo
- Harness personalizado
- Avaliações do LlamaIndex
- Nenhuma
- Outra
Qual é a principal linguagem de programação que você usa para desenvolvimento RAG?
- Python
- JavaScript/TypeScript
- Java
- Go
- C
- Rust
- Outra
Quão crítica é a qualidade de recuperação para o sucesso geral do seu sistema RAG?
Quantos anos de experiência profissional você tem em software, dados ou ML?
- 0–1
- 2–4
- 5–9
- 10–14
- 15+
- Prefiro não informar
Obrigado por concluir esta pesquisa! Sua contribuição é valiosa e ajudará a melhorar os sistemas RAG e as ferramentas para desenvolvedores. Todos os resultados serão reportados apenas de forma agregada.
Nos últimos 30 dias, quão bem o contexto recuperado atendeu aos requisitos da sua tarefa?
Nos últimos 30 dias, quanto você confia na correção das evidências citadas nas saídas do seu sistema RAG?
Quais métricas melhor refletem a qualidade do seu RAG atualmente? Selecione todas as que se aplicam.
- Precision@k
- Recall@k
- MRR
- nDCG
- Fidelidade da resposta
- Precisão/recall de contexto
- Pontuação de fundamentação
- Avaliações humanas
- Sinais de uso em produção
- Métricas internas personalizadas
Qual é o seu principal vector store ou backend de recuperação?
- Pinecone
- Weaviate
- Milvus
- FAISS
- Elasticsearch/OpenSearch
- pgvector
- Chroma
- Vespa
- Não se aplica
- Outro
Quão satisfeito você está com seu sistema RAG no geral atualmente?
Em qual região você trabalha principalmente?
- África
- Ásia
- Europa
- América do Norte
- Oceania
- América do Sul
- Prefiro não informar
Como você define ou ajusta o top-k e parâmetros de recuperação relacionados?
- Experimentação manual
- Busca em grade/aleatória
- Otimização bayesiana
- Ajuste automático do fornecedor
- Política de recuperação aprendida
- Não ajustado
- Outro
Classifique seus 3 estilos preferidos de exibição de citação/fundamentação.
- Inline por frase
- Notas finais numeradas
- Painel de evidências recolhível
- Top-k fontes com pontuações
- Link para os trechos completos
- Exibir apenas sob demanda
Se você usa uma métrica personalizada, descreva-a brevemente e como você a calcula.
Qual modelo de embedding é sua escolha principal?
- OpenAI text-embedding-3
- OpenAI small embedding
- Cohere Embed
- VoyageAI
- Jina embeddings
- Família E5
- Instructor
- Família BGE
- Modelo local
- Outro
Classifique suas 3 principais prioridades para melhorar seu sistema RAG nos próximos 3 meses.
- Melhorar precision/recall de recuperação
- Melhorar fundamentação/citações
- Reduzir latência
- Reduzir custo por consulta
- Escalar para mais fontes de dados
- Fortalecer o pipeline de avaliação
- Segurança/conformidade
- Ergonomia para desenvolvedores
Qual é o tamanho aproximado da sua organização (número de funcionários)?
- 1–10
- 11–50
- 51–200
- 201–1.000
- 1.001–5.000
- 5.001+
- Prefiro não informar
Nos últimos 30 dias, com que frequência você encontrou trechos irrelevantes ou fora do tópico nos resultados de recuperação?
Nos últimos 30 dias, com que frequência você observou alucinações nas saídas do seu RAG apesar da fundamentação?
Quão automatizado é seu fluxo de trabalho de avaliação?
- Nenhum (apenas manual)
- Alguns scripts
- Verificações integradas ao CI
- Avaliação contínua em produção
Você usa um reranker após a recuperação inicial?
- Sim
- Não
- Em experimentação
Com base em suas respostas nesta pesquisa, compartilhe quaisquer pensamentos ou experiências adicionais sobre seus desafios de recuperação ou fundamentação em RAG.
Qual é o principal setor ou domínio do seu trabalho com RAG?
- Tecnologia
- Finanças
- Saúde/Ciências da vida
- Varejo/Bens de consumo
- Educação
- Governo/Setor público
- Manufatura
- Mídia/Entretenimento
- Outro
- Prefiro não informar
Nos últimos 30 dias, com que frequência você encontrou contexto ausente (informação-chave não recuperada)?
Descreva uma falha de fundamentação recente que você encontrou e seu impacto no seu trabalho.
Com que frequência você executa benchmarks de RAG?
- Antes de cada release
- Semanalmente
- Quinzenalmente
- Mensalmente
- Trimestralmente
- Apenas pontualmente
Qual reranker você usa com mais frequência?
- Cohere Rerank
- Voyage Rerank
- Jina Reranker
- Cross-encoder (ex.: MS MARCO)
- Reranker auto-hospedado
- Outro
Nos últimos 30 dias, com que frequência você encontrou conteúdo desatualizado ou obsoleto nos resultados de recuperação?
Gostaríamos de entender mais sobre sua experiência com a qualidade de fundamentação e citação. Um moderador de IA fará algumas perguntas de acompanhamento.
Qual é sua meta de latência ponta a ponta do RAG por consulta?
- < 200 ms
- 200–500 ms
- 500 ms–1 s
- 1–2 s
- 2–5 s
- > 5 s
- Sem meta específica
Nos últimos 30 dias, com que frequência você encontrou chunks duplicados ou quase duplicados nos resultados de recuperação?
O que está incluído
Acompanhamento com IA
Sondagens adaptativas nas respostas abertas que revelam detalhes que um formulário estático deixaria passar.
Verificações de atenção
Proteções integradas contra respostas apressadas e participantes de baixa qualidade.
Textos escritos por IA
Redação, ordem e ramificações escritas pela IA, ajustadas ao seu objetivo de pesquisa.
Relatório automático
Temas, citações e um resumo em linguagem simples se escrevem sozinhos assim que as respostas chegam.
Perguntas frequentes
Quais perguntas estão no modelo “Avaliação de Qualidade e Fundamentação de Sistemas RAG (Pesquisa com Desenvolvedores)”?
O modelo inclui 36 perguntas prontas para usar, começando por: “Bem-vindo! Obrigado por participar desta pesquisa sobre sua experiência com sistemas de Retrieval-Augmented Generation (…” · “Você construiu ou manteve um sistema RAG nos últimos 6 meses?” · “Qual função melhor descreve seu trabalho no dia a dia?”. O conjunto completo aparece acima e todas as perguntas podem ser editadas.
Quanto tempo leva para responder a esta pesquisa?
Os participantes normalmente terminam as 36 perguntas em cerca de 15 minutos.
Posso personalizar este modelo?
Sim: cada pergunta, cada opção de resposta e a ordem podem ser editadas antes de publicar. Você pode adicionar ou remover perguntas, ou pedir ao editor com IA para refazer a pesquisa em torno do seu objetivo.
Este modelo é gratuito?
Sim. Abra no editor e comece a personalizar agora: não é preciso criar conta para testar, e o plano gratuito cobre a publicação da sua pesquisa.
Pronto para publicar?
Abra este modelo no editor. Tudo é seu para mudar antes de o primeiro participante ver.
Modelos relacionados
Mais estudos sobre temas semelhantes.
Pesquisa sobre Justiça de Limites de Taxa de API e Impacto na Produtividade
Mede as percepções dos desenvolvedores sobre a justiça dos limites de taxa de API, clareza da documentação, impacto na produtividade e estratégias de contorno. Desenvolvida para equipes de produto de API e pesquisadores de experiência do desenvolvedor que buscam dados acionáveis para melhorar políticas de throttling e níveis de preços.
Ver modeloPesquisa sobre Confiança, Segurança e Preferências de Salvaguardas em IA Generativa
Mede a confiança do consumidor em ferramentas de IA generativa, os riscos de segurança percebidos, as expectativas de transparência e as preferências de salvaguardas para orientar o design responsável de produtos de IA e políticas.
Ver modeloReprodutibilidade em Pesquisas Moderadas por IA: Uma Avaliação de Pesquisadores
Esta pesquisa explora as experiências dos pesquisadores com reprodutibilidade, transparência e qualidade de dados em pesquisas moderadas por IA. Ela serve como modelo de estudo de replicação para entender as práticas atuais, identificar barreiras e avaliar o papel da transparência da plataforma em possibilitar estudos moderados por IA que sejam reprodutíveis.
Ver modeloPesquisa de Percepções sobre Justiça e Representatividade em Avaliações para Desenvolvedores
Mede as percepções de desenvolvedores de software sobre justiça, viés e representatividade em suas práticas de avaliação. Ideal para lideranças de engenharia e equipes de DEI que buscam identificar lacunas na metodologia de avaliação e construir processos mais inclusivos.
Ver modeloAvaliação da Qualidade de Dados de Entrevistas com IA
Um instrumento de codificação de meta-pesquisa para que pesquisadores avaliem e comparem sistematicamente a qualidade de dados de entrevistas moderadas por IA em comparação com métodos qualitativos tradicionais. Projetado para uso repetido em múltiplos conjuntos de dados. Tempo estimado de conclusão: 12 a 15 minutos por conjunto de dados avaliado.
Ver modeloPesquisa sobre Produtividade de Desenvolvedores e Adoção de Ferramentas de IA
Mede a produtividade dos desenvolvedores, a adoção e as barreiras de ferramentas de codificação com IA, as práticas de qualidade de código e o crescimento profissional para equipes de engenharia. Projetada para conclusão em 6 a 8 minutos, com lógica de ramificação para usuários de ferramentas de IA versus não usuários.
Ver modelo