Todos os modelos
Sample Templates

Avaliação de Qualidade e Fundamentação de Sistemas RAG (Pesquisa com Desenvolvedores)

Avalia as experiências de desenvolvedores com sistemas de Retrieval-Augmented Generation em relação à qualidade de recuperação, precisão de fundamentação, práticas de avaliação e infraestrutura. Elaborada para engenheiros de ML, engenheiros de backend e cientistas de dados que estejam ativamente construindo ou mantendo pipelines de RAG.

Perguntas de exemplo

Uma prévia do que há no modelo. Todas as perguntas podem ser editadas antes de publicar.

36 perguntas · ~15 min
Q01
Mensagem

Bem-vindo! Obrigado por participar desta pesquisa sobre sua experiência com sistemas de Retrieval-Augmented Generation (RAG). Esta pesquisa leva aproximadamente 15 minutos. Suas respostas são completamente anônimas, reportadas apenas de forma agregada e utilizadas para fins de pesquisa interna. Não há respostas certas ou erradas — estamos interessados em suas opiniões e experiências sinceras. A participação é voluntária, e você pode parar a qualquer momento.

Q02
Múltipla escolha

Você construiu ou manteve um sistema RAG nos últimos 6 meses?

  • Sim
  • Não
  • Não tenho certeza
Q03
Múltipla escolha

Qual função melhor descreve seu trabalho no dia a dia?

  • Engenheiro de ML
  • Engenheiro de backend
  • Cientista de dados
  • MLOps/Plataforma
  • Engenheiro de produto
  • Pesquisador
  • Arquiteto/Líder técnico
  • Outro
Q04
Múltipla escolha

Quais fontes de conteúdo alimentam seu recuperador atualmente? Selecione todas as que se aplicam.

  • Documentos proprietários
  • Repositórios de código
  • Base de conhecimento do produto
  • Rastreamento web
  • Documentação de API de fornecedores
  • Logs do Slack/Chat
  • Tickets de suporte
  • Wiki/Confluence
  • Banco de dados/data warehouse
  • Não se aplica
  • Outro
Q05
Múltipla escolha

Como as respostas do modelo são fundamentadas ou citadas em seu sistema RAG? Selecione todas as que se aplicam.

  • Citações inline com URLs
  • Citações inline com IDs de documentos
  • Bloco de evidências após a resposta
  • Saídas de ferramentas incluídas na íntegra
  • Lista estruturada de evidências em JSON
  • Sem fundamentação/citações
  • Outro
Q06
Múltipla escolha

Quais ferramentas ou bibliotecas de avaliação você usa para RAG? Selecione todas as que se aplicam.

  • Ragas
  • TruLens
  • DeepEval
  • Promptfoo
  • Harness personalizado
  • Avaliações do LlamaIndex
  • Nenhuma
  • Outra
Q07
Múltipla escolha

Qual é a principal linguagem de programação que você usa para desenvolvimento RAG?

  • Python
  • JavaScript/TypeScript
  • Java
  • Go
  • C
  • Rust
  • Outra
Q08
Escala de opinião

Quão crítica é a qualidade de recuperação para o sucesso geral do seu sistema RAG?

Escala: 17
Mín:Nada críticaMáx:Extremamente crítica
Q09
Múltipla escolha

Quantos anos de experiência profissional você tem em software, dados ou ML?

  • 0–1
  • 2–4
  • 5–9
  • 10–14
  • 15+
  • Prefiro não informar
Q10
Mensagem

Obrigado por concluir esta pesquisa! Sua contribuição é valiosa e ajudará a melhorar os sistemas RAG e as ferramentas para desenvolvedores. Todos os resultados serão reportados apenas de forma agregada.

Q11
Escala de opinião

Nos últimos 30 dias, quão bem o contexto recuperado atendeu aos requisitos da sua tarefa?

Escala: 17
Mín:Muito abaixo das necessidadesMáx:Muito acima das necessidades
Q12
Escala de opinião

Nos últimos 30 dias, quanto você confia na correção das evidências citadas nas saídas do seu sistema RAG?

Escala: 17
Mín:Nenhuma confiançaMáx:Confiança total
Q13
Múltipla escolha

Quais métricas melhor refletem a qualidade do seu RAG atualmente? Selecione todas as que se aplicam.

  • Precision@k
  • Recall@k
  • MRR
  • nDCG
  • Fidelidade da resposta
  • Precisão/recall de contexto
  • Pontuação de fundamentação
  • Avaliações humanas
  • Sinais de uso em produção
  • Métricas internas personalizadas
Q14
Múltipla escolha

Qual é o seu principal vector store ou backend de recuperação?

  • Pinecone
  • Weaviate
  • Milvus
  • FAISS
  • Elasticsearch/OpenSearch
  • pgvector
  • Chroma
  • Vespa
  • Não se aplica
  • Outro
Q15
Escala de opinião

Quão satisfeito você está com seu sistema RAG no geral atualmente?

Escala: 17
Mín:Nada satisfeitoMáx:Extremamente satisfeito
Q16
Múltipla escolha

Em qual região você trabalha principalmente?

  • África
  • Ásia
  • Europa
  • América do Norte
  • Oceania
  • América do Sul
  • Prefiro não informar
Q17
Múltipla escolha

Como você define ou ajusta o top-k e parâmetros de recuperação relacionados?

  • Experimentação manual
  • Busca em grade/aleatória
  • Otimização bayesiana
  • Ajuste automático do fornecedor
  • Política de recuperação aprendida
  • Não ajustado
  • Outro
Q18
Ordenação

Classifique seus 3 estilos preferidos de exibição de citação/fundamentação.

  1. Inline por frase
  2. Notas finais numeradas
  3. Painel de evidências recolhível
  4. Top-k fontes com pontuações
  5. Link para os trechos completos
  6. Exibir apenas sob demanda
Arraste para ordenar
Q19
Texto longo

Se você usa uma métrica personalizada, descreva-a brevemente e como você a calcula.

Q20
Múltipla escolha

Qual modelo de embedding é sua escolha principal?

  • OpenAI text-embedding-3
  • OpenAI small embedding
  • Cohere Embed
  • VoyageAI
  • Jina embeddings
  • Família E5
  • Instructor
  • Família BGE
  • Modelo local
  • Outro
Q21
Ordenação

Classifique suas 3 principais prioridades para melhorar seu sistema RAG nos próximos 3 meses.

  1. Melhorar precision/recall de recuperação
  2. Melhorar fundamentação/citações
  3. Reduzir latência
  4. Reduzir custo por consulta
  5. Escalar para mais fontes de dados
  6. Fortalecer o pipeline de avaliação
  7. Segurança/conformidade
  8. Ergonomia para desenvolvedores
Arraste para ordenar
Q22
Múltipla escolha

Qual é o tamanho aproximado da sua organização (número de funcionários)?

  • 1–10
  • 11–50
  • 51–200
  • 201–1.000
  • 1.001–5.000
  • 5.001+
  • Prefiro não informar
Q23
Escala de opinião

Nos últimos 30 dias, com que frequência você encontrou trechos irrelevantes ou fora do tópico nos resultados de recuperação?

Escala: 15
Mín:NuncaMáx:Com muita frequência
Q24
Escala de opinião

Nos últimos 30 dias, com que frequência você observou alucinações nas saídas do seu RAG apesar da fundamentação?

Escala: 15
Mín:NuncaMáx:Com muita frequência
Q25
Lista suspensa

Quão automatizado é seu fluxo de trabalho de avaliação?

  • Nenhum (apenas manual)
  • Alguns scripts
  • Verificações integradas ao CI
  • Avaliação contínua em produção
Q26
Múltipla escolha

Você usa um reranker após a recuperação inicial?

  • Sim
  • Não
  • Em experimentação
Q27
Texto longo

Com base em suas respostas nesta pesquisa, compartilhe quaisquer pensamentos ou experiências adicionais sobre seus desafios de recuperação ou fundamentação em RAG.

Q28
Múltipla escolha

Qual é o principal setor ou domínio do seu trabalho com RAG?

  • Tecnologia
  • Finanças
  • Saúde/Ciências da vida
  • Varejo/Bens de consumo
  • Educação
  • Governo/Setor público
  • Manufatura
  • Mídia/Entretenimento
  • Outro
  • Prefiro não informar
Q29
Escala de opinião

Nos últimos 30 dias, com que frequência você encontrou contexto ausente (informação-chave não recuperada)?

Escala: 15
Mín:NuncaMáx:Com muita frequência
Q30
Texto longo

Descreva uma falha de fundamentação recente que você encontrou e seu impacto no seu trabalho.

Q31
Lista suspensa

Com que frequência você executa benchmarks de RAG?

  • Antes de cada release
  • Semanalmente
  • Quinzenalmente
  • Mensalmente
  • Trimestralmente
  • Apenas pontualmente
Q32
Múltipla escolha

Qual reranker você usa com mais frequência?

  • Cohere Rerank
  • Voyage Rerank
  • Jina Reranker
  • Cross-encoder (ex.: MS MARCO)
  • Reranker auto-hospedado
  • Outro
Q33
Escala de opinião

Nos últimos 30 dias, com que frequência você encontrou conteúdo desatualizado ou obsoleto nos resultados de recuperação?

Escala: 15
Mín:NuncaMáx:Com muita frequência
Q34
Entrevista com IA

Gostaríamos de entender mais sobre sua experiência com a qualidade de fundamentação e citação. Um moderador de IA fará algumas perguntas de acompanhamento.

Q35
Lista suspensa

Qual é sua meta de latência ponta a ponta do RAG por consulta?

  • < 200 ms
  • 200–500 ms
  • 500 ms–1 s
  • 1–2 s
  • 2–5 s
  • > 5 s
  • Sem meta específica
Q36
Escala de opinião

Nos últimos 30 dias, com que frequência você encontrou chunks duplicados ou quase duplicados nos resultados de recuperação?

Escala: 15
Mín:NuncaMáx:Com muita frequência

O que está incluído

  • Acompanhamento com IA

    Sondagens adaptativas nas respostas abertas que revelam detalhes que um formulário estático deixaria passar.

  • Verificações de atenção

    Proteções integradas contra respostas apressadas e participantes de baixa qualidade.

  • Textos escritos por IA

    Redação, ordem e ramificações escritas pela IA, ajustadas ao seu objetivo de pesquisa.

  • Relatório automático

    Temas, citações e um resumo em linguagem simples se escrevem sozinhos assim que as respostas chegam.

Perguntas frequentes

Quais perguntas estão no modelo “Avaliação de Qualidade e Fundamentação de Sistemas RAG (Pesquisa com Desenvolvedores)”?

O modelo inclui 36 perguntas prontas para usar, começando por: “Bem-vindo! Obrigado por participar desta pesquisa sobre sua experiência com sistemas de Retrieval-Augmented Generation (…” · “Você construiu ou manteve um sistema RAG nos últimos 6 meses?” · “Qual função melhor descreve seu trabalho no dia a dia?”. O conjunto completo aparece acima e todas as perguntas podem ser editadas.

Quanto tempo leva para responder a esta pesquisa?

Os participantes normalmente terminam as 36 perguntas em cerca de 15 minutos.

Posso personalizar este modelo?

Sim: cada pergunta, cada opção de resposta e a ordem podem ser editadas antes de publicar. Você pode adicionar ou remover perguntas, ou pedir ao editor com IA para refazer a pesquisa em torno do seu objetivo.

Este modelo é gratuito?

Sim. Abra no editor e comece a personalizar agora: não é preciso criar conta para testar, e o plano gratuito cobre a publicação da sua pesquisa.

Pronto para publicar?

Abra este modelo no editor. Tudo é seu para mudar antes de o primeiro participante ver.

Modelos relacionados

Mais estudos sobre temas semelhantes.

Ver todos
Sample Templates

Pesquisa sobre Justiça de Limites de Taxa de API e Impacto na Produtividade

Mede as percepções dos desenvolvedores sobre a justiça dos limites de taxa de API, clareza da documentação, impacto na produtividade e estratégias de contorno. Desenvolvida para equipes de produto de API e pesquisadores de experiência do desenvolvedor que buscam dados acionáveis para melhorar políticas de throttling e níveis de preços.

Ver modelo
Sample Templates

Pesquisa sobre Confiança, Segurança e Preferências de Salvaguardas em IA Generativa

Mede a confiança do consumidor em ferramentas de IA generativa, os riscos de segurança percebidos, as expectativas de transparência e as preferências de salvaguardas para orientar o design responsável de produtos de IA e políticas.

Ver modelo
Sample Templates

Reprodutibilidade em Pesquisas Moderadas por IA: Uma Avaliação de Pesquisadores

Esta pesquisa explora as experiências dos pesquisadores com reprodutibilidade, transparência e qualidade de dados em pesquisas moderadas por IA. Ela serve como modelo de estudo de replicação para entender as práticas atuais, identificar barreiras e avaliar o papel da transparência da plataforma em possibilitar estudos moderados por IA que sejam reprodutíveis.

Ver modelo
Sample Templates

Pesquisa de Percepções sobre Justiça e Representatividade em Avaliações para Desenvolvedores

Mede as percepções de desenvolvedores de software sobre justiça, viés e representatividade em suas práticas de avaliação. Ideal para lideranças de engenharia e equipes de DEI que buscam identificar lacunas na metodologia de avaliação e construir processos mais inclusivos.

Ver modelo
Sample Templates

Avaliação da Qualidade de Dados de Entrevistas com IA

Um instrumento de codificação de meta-pesquisa para que pesquisadores avaliem e comparem sistematicamente a qualidade de dados de entrevistas moderadas por IA em comparação com métodos qualitativos tradicionais. Projetado para uso repetido em múltiplos conjuntos de dados. Tempo estimado de conclusão: 12 a 15 minutos por conjunto de dados avaliado.

Ver modelo
Sample Templates

Pesquisa sobre Produtividade de Desenvolvedores e Adoção de Ferramentas de IA

Mede a produtividade dos desenvolvedores, a adoção e as barreiras de ferramentas de codificação com IA, as práticas de qualidade de código e o crescimento profissional para equipes de engenharia. Projetada para conclusão em 6 a 8 minutos, com lógica de ramificação para usuários de ferramentas de IA versus não usuários.

Ver modelo