Todas las plantillas
Sample Templates

Evaluación de Calidad y Fundamentación de Sistemas RAG (Encuesta para Desarrolladores)

Evalúa las experiencias de los desarrolladores con sistemas de Generación Aumentada por Recuperación (RAG) en cuanto a calidad de recuperación, precisión de la fundamentación, prácticas de evaluación e infraestructura. Diseñada para ingenieros de ML, ingenieros de backend y científicos de datos que construyen o mantienen activamente pipelines de RAG.

Preguntas de ejemplo

Una vista previa del contenido de la plantilla. Todas las preguntas son editables antes de publicar.

36 preguntas · ~15 min
Q01
Mensaje

¡Bienvenido! Gracias por participar en esta encuesta sobre su experiencia con sistemas de Generación Aumentada por Recuperación (RAG). Esta encuesta toma aproximadamente 15 minutos. Sus respuestas son completamente anónimas, se reportan únicamente de forma agregada y se utilizan con fines de investigación interna. No hay respuestas correctas ni incorrectas: nos interesan sus opiniones y experiencias honestas. La participación es voluntaria y puede detenerse en cualquier momento.

Q02
Opción múltiple

¿Ha construido o mantenido un sistema RAG en los últimos 6 meses?

  • No
  • No estoy seguro
Q03
Opción múltiple

¿Qué rol describe mejor su trabajo diario?

  • Ingeniero de ML
  • Ingeniero de backend
  • Científico de datos
  • MLOps/Plataforma
  • Ingeniero de producto
  • Investigador
  • Arquitecto/Líder técnico
  • Otro
Q04
Opción múltiple

¿Qué fuentes de contenido alimentan actualmente su retriever? Seleccione todas las que correspondan.

  • Documentos propietarios
  • Repositorios de código
  • Base de conocimiento del producto
  • Rastreo web
  • Documentación de API de proveedores
  • Registros de Slack/Chat
  • Tickets de soporte
  • Wiki/Confluence
  • Base de datos/almacén de datos
  • No aplica
  • Otro
Q05
Opción múltiple

¿Cómo se fundamentan o citan las respuestas del modelo en su sistema RAG? Seleccione todas las que correspondan.

  • Citas en línea con URLs
  • Citas en línea con IDs de documentos
  • Bloque de evidencia después de la respuesta
  • Salidas de herramientas incluidas textualmente
  • Lista de evidencia en JSON estructurado
  • Sin fundamentación/citas
  • Otro
Q06
Opción múltiple

¿Qué herramientas o bibliotecas de evaluación utiliza para RAG? Seleccione todas las que correspondan.

  • Ragas
  • TruLens
  • DeepEval
  • Promptfoo
  • Harness personalizado
  • Evaluaciones de LlamaIndex
  • Ninguna
  • Otra
Q07
Opción múltiple

¿Cuál es el lenguaje de programación principal que utiliza para el desarrollo de RAG?

  • Python
  • JavaScript/TypeScript
  • Java
  • Go
  • C
  • Rust
  • Otro
Q08
Escala de opinión

¿Qué tan crítica es la calidad de recuperación para el éxito general de su sistema RAG?

Escala: 17
Mín:Nada críticaMáx:Extremadamente crítica
Q09
Opción múltiple

¿Cuántos años de experiencia profesional tiene en software, datos o ML?

  • 0–1
  • 2–4
  • 5–9
  • 10–14
  • 15+
  • Prefiero no responder
Q10
Mensaje

¡Gracias por completar esta encuesta! Su aporte es valioso y ayudará a mejorar los sistemas RAG y las herramientas para desarrolladores. Todos los resultados se reportarán únicamente de forma agregada.

Q11
Escala de opinión

En los últimos 30 días, ¿qué tan bien cumplió el contexto recuperado con los requisitos de su tarea?

Escala: 17
Mín:Muy por debajo de las necesidadesMáx:Muy por encima de las necesidades
Q12
Escala de opinión

Durante los últimos 30 días, ¿cuánto confía en la corrección de la evidencia citada en las salidas de su sistema RAG?

Escala: 17
Mín:Ninguna confianzaMáx:Confianza total
Q13
Opción múltiple

¿Qué métricas reflejan mejor la calidad actual de su RAG? Seleccione todas las que correspondan.

  • Precision@k
  • Recall@k
  • MRR
  • nDCG
  • Fidelidad de la respuesta
  • Precisión/recall del contexto
  • Puntuación de fundamentación
  • Valoraciones humanas
  • Señales de uso en producción
  • Métricas internas personalizadas
Q14
Opción múltiple

¿Cuál es su almacén de vectores o backend de retriever principal?

  • Pinecone
  • Weaviate
  • Milvus
  • FAISS
  • Elasticsearch/OpenSearch
  • pgvector
  • Chroma
  • Vespa
  • No aplica
  • Otro
Q15
Escala de opinión

¿Qué tan satisfecho está actualmente con su sistema RAG en general?

Escala: 17
Mín:Nada satisfechoMáx:Extremadamente satisfecho
Q16
Opción múltiple

¿En qué región trabaja principalmente?

  • África
  • Asia
  • Europa
  • América del Norte
  • Oceanía
  • América del Sur
  • Prefiero no responder
Q17
Opción múltiple

¿Cómo configura o ajusta el top-k y los parámetros de recuperación relacionados?

  • Experimentación manual
  • Búsqueda en cuadrícula/aleatoria
  • Optimización bayesiana
  • Autoajuste del proveedor
  • Política de recuperación aprendida
  • Sin ajuste
  • Otro
Q18
Ordenación

Clasifique sus 3 estilos preferidos de visualización de citas/fundamentación.

  1. En línea por oración
  2. Notas finales numeradas
  3. Panel de evidencia contraíble
  4. Top-k de fuentes con puntuaciones
  5. Enlace a los pasajes completos
  6. Mostrar solo bajo demanda
Arrastre para ordenar
Q19
Texto largo

Si utiliza una métrica personalizada, describa brevemente en qué consiste y cómo la calcula.

Q20
Opción múltiple

¿Cuál es su modelo de embeddings principal?

  • OpenAI text-embedding-3
  • OpenAI small embedding
  • Cohere Embed
  • VoyageAI
  • Jina embeddings
  • Familia E5
  • Instructor
  • Familia BGE
  • Modelo local
  • Otro
Q21
Ordenación

Clasifique sus 3 prioridades principales para mejorar su sistema RAG en los próximos 3 meses.

  1. Mejorar precision/recall de recuperación
  2. Mejor fundamentación/citas
  3. Reducir la latencia
  4. Reducir el costo por consulta
  5. Escalar a más fuentes de datos
  6. Reforzar el pipeline de evaluación
  7. Seguridad/cumplimiento
  8. Ergonomía del desarrollador
Arrastre para ordenar
Q22
Opción múltiple

¿Cuál es el tamaño aproximado de su organización (número de empleados)?

  • 1–10
  • 11–50
  • 51–200
  • 201–1.000
  • 1.001–5.000
  • 5.001+
  • Prefiero no responder
Q23
Escala de opinión

En los últimos 30 días, ¿con qué frecuencia encontró pasajes irrelevantes o fuera de tema en los resultados de recuperación?

Escala: 15
Mín:NuncaMáx:Con mucha frecuencia
Q24
Escala de opinión

En los últimos 30 días, ¿con qué frecuencia observó alucinaciones en las salidas de su RAG a pesar de la fundamentación?

Escala: 15
Mín:NuncaMáx:Con mucha frecuencia
Q25
Lista desplegable

¿Qué tan automatizado está su flujo de trabajo de evaluación?

  • Ninguno (solo manual)
  • Algunos scripts
  • Comprobaciones integradas en CI
  • Evaluación continua en producción
Q26
Opción múltiple

¿Utiliza un reranker después de la recuperación inicial?

  • No
  • Experimentando
Q27
Texto largo

Con base en sus respuestas en esta encuesta, comparta cualquier idea o experiencia adicional sobre sus desafíos de recuperación o fundamentación en RAG.

Q28
Opción múltiple

¿Cuál es la industria o el dominio principal de su trabajo con RAG?

  • Tecnología
  • Finanzas
  • Salud/Ciencias de la vida
  • Retail/Bienes de consumo
  • Educación
  • Gobierno/Sector público
  • Manufactura
  • Medios/Entretenimiento
  • Otro
  • Prefiero no responder
Q29
Escala de opinión

En los últimos 30 días, ¿con qué frecuencia encontró contexto faltante (información clave no recuperada)?

Escala: 15
Mín:NuncaMáx:Con mucha frecuencia
Q30
Texto largo

Describa una falla de fundamentación reciente que haya encontrado y su impacto en su trabajo.

Q31
Lista desplegable

¿Con qué frecuencia ejecuta benchmarks de RAG?

  • Antes de cada lanzamiento
  • Semanalmente
  • Quincenalmente
  • Mensualmente
  • Trimestralmente
  • Solo de forma puntual
Q32
Opción múltiple

¿Qué reranker utiliza con más frecuencia?

  • Cohere Rerank
  • Voyage Rerank
  • Jina Reranker
  • Cross-encoder (p. ej., MS MARCO)
  • Reranker autoalojado
  • Otro
Q33
Escala de opinión

En los últimos 30 días, ¿con qué frecuencia encontró contenido obsoleto o desactualizado en los resultados de recuperación?

Escala: 15
Mín:NuncaMáx:Con mucha frecuencia
Q34
Entrevista con IA

Nos gustaría comprender mejor su experiencia con la calidad de la fundamentación y las citas. Un moderador de IA le hará un par de preguntas de seguimiento.

Q35
Lista desplegable

¿Cuál es su objetivo de latencia RAG de extremo a extremo por consulta?

  • < 200 ms
  • 200–500 ms
  • 500 ms–1 s
  • 1–2 s
  • 2–5 s
  • > 5 s
  • Sin objetivo específico
Q36
Escala de opinión

En los últimos 30 días, ¿con qué frecuencia encontró fragmentos duplicados o casi duplicados en los resultados de recuperación?

Escala: 15
Mín:NuncaMáx:Con mucha frecuencia

Qué incluye

  • Seguimientos con IA

    Preguntas adaptativas sobre las respuestas abiertas que sacan detalles que un formulario estático pasaría por alto.

  • Controles de atención

    Protecciones integradas frente a respuestas apresuradas y participantes de baja calidad.

  • Textos redactados por IA

    Redacción, orden y ramificaciones escritos por la IA, ajustados a su objetivo de investigación.

  • Informe automático

    Los temas, las citas y un resumen en lenguaje claro se escriben solos en cuanto llegan las respuestas.

Preguntas frecuentes

¿Qué preguntas incluye la plantilla «Evaluación de Calidad y Fundamentación de Sistemas RAG (Encuesta para Desarrolladores)»?

La plantilla incluye 36 preguntas listas para usar, empezando por: «¡Bienvenido! Gracias por participar en esta encuesta sobre su experiencia con sistemas de Generación Aumentada por Recup…» · «¿Ha construido o mantenido un sistema RAG en los últimos 6 meses?» · «¿Qué rol describe mejor su trabajo diario?». El conjunto completo se muestra arriba y todas las preguntas son editables.

¿Cuánto se tarda en completar esta encuesta?

Los participantes suelen terminar las 36 preguntas en unos 15 minutos.

¿Puedo personalizar esta plantilla?

Sí: cada pregunta, cada opción de respuesta y el orden son editables antes de publicar. Puede añadir o quitar preguntas, o pedir al editor con IA que rehaga la encuesta en torno a su objetivo de investigación.

¿Esta plantilla es gratuita?

Sí. Ábrala en el editor y empiece a personalizarla ahora mismo: no necesita cuenta para probarla, y el plan gratuito cubre la publicación de su encuesta.

¿Listo para publicar?

Abra esta plantilla en el editor. Todo es suyo para cambiarlo antes de que lo vea el primer participante.

Plantillas relacionadas

Más estudios sobre temas similares.

Ver todas
Sample Templates

Encuesta sobre la equidad de los límites de tasa de las API y su impacto en la productividad

Mide las percepciones de los desarrolladores sobre la equidad de los límites de tasa de las API, la claridad de la documentación, el impacto en la productividad y las estrategias de afrontamiento. Diseñada para equipos de producto de API e investigadores de experiencia de desarrollador que buscan datos accionables para mejorar las políticas de limitación y los niveles de precios.

Ver plantilla
Sample Templates

Encuesta sobre tolerancia a errores de IA y experiencia de recuperación

Mide las experiencias de los usuarios con los errores de la IA, las preferencias de recuperación y el impacto resultante en la confianza. Diseñada para equipos de productos de IA que buscan priorizar mejoras en la fiabilidad y reducir la pérdida de clientes provocada por errores.

Ver plantilla
Sample Templates

Encuesta de Percepciones sobre Equidad y Representación en la Evaluación para Desarrolladores

Mide las percepciones de los desarrolladores de software sobre la equidad, el sesgo y la representatividad en sus prácticas de evaluación. Ideal para equipos de liderazgo de ingeniería y de DEI que buscan identificar brechas en la metodología de evaluación y construir procesos más inclusivos.

Ver plantilla
Sample Templates

Encuesta sobre Productividad de Desarrolladores y Adopción de Herramientas de IA

Mide la productividad de los desarrolladores, la adopción y las barreras de las herramientas de codificación con IA, las prácticas de calidad del código y el crecimiento profesional de los equipos de ingeniería. Diseñada para completarse en 6 a 8 minutos con lógica de ramificación para usuarios y no usuarios de herramientas de IA.

Ver plantilla
Sample Templates

Evaluación de la Carga de Trabajo y Recuperación de Guardias de SRE/DevOps

Mide la carga de alertas de guardia, el impacto de las interrupciones, la eficacia de la recuperación y las preferencias de compensación en los equipos de ingeniería para comparar la carga de trabajo e identificar mejoras accionables que reduzcan el agotamiento.

Ver plantilla
Sample Templates

Evaluación de Confiabilidad y Respuesta a Incidentes de DevOps

Compara el tiempo de actividad, la respuesta a incidentes, la carga de guardias, el manejo de errores y las prioridades de SLA entre equipos de ingeniería. Diseñada para SRE, ingenieros de DevOps y desarrolladores de software que gestionan sistemas en producción.

Ver plantilla