Para validar el instrumento de tu tesis de educación con juicio de expertos sigues seis pasos: defines qué mide cada ítem, eliges a los jueces, les entregas una matriz de evaluación, calculas un coeficiente de acuerdo (la V de Aiken es el más usado en Latinoamérica), ajustas los ítems y lo reportas en el capítulo de método. Esta guía los desarrolla con un ejemplo calculado y con las fuentes originales que puedes citar.
Paso 1: ¿Qué es la validez de contenido y por qué te la piden?
La validez de contenido responde una pregunta concreta: ¿los ítems de tu instrumento representan bien el constructo que quieres medir? En una tesis de educación puede tratarse de un cuestionario sobre estrategias didácticas, una pauta de observación de clases o una escala de actitudes hacia la lectura. Si los ítems no cubren el constructo, ningún análisis estadístico posterior lo arregla.
El juicio de expertos es una forma de reunir evidencia de validez de contenido: personas con experiencia en el tema evalúan cada ítem y tú cuantificas su acuerdo. No es la única evidencia de validez que existe, y por sí solo no prueba que el instrumento sea confiable: la confiabilidad se calcula aparte, con los datos de una prueba piloto o de tu muestra. La comisión suele pedir ambos.
Un buen punto de partida teórico es el trabajo de Pedrosa, Suárez-Álvarez y García-Cueto (2014), Evidencias sobre la validez de contenido: avances teóricos y métodos para su estimación, publicado en Acción Psicológica, 10(2). Ábrelo antes de redactar: te ayuda a explicar con vocabulario correcto qué es la validez de contenido y qué métodos existen para estimarla.
Paso 2: Define bien el constructo y los ítems antes de convocar jueces
Los jueces no pueden evaluar ítems que no tienen un marco. Antes de enviar nada, ten listos tres documentos:
- Definición del constructo: qué entiendes por, por ejemplo, «clima de aula» o «autoeficacia docente», con la fuente que usas.
- Dimensiones e indicadores: la estructura de tu variable. Si no la tienes aún, arma primero la tabla de operacionalización de variables.
- Versión preliminar del instrumento: con ítems redactados, escala de respuesta definida e instrucciones para el participante.
Si todavía no sabes qué tipo de instrumento necesitas, revisa las plantillas de instrumentos de recolección de datos.
Paso 3: Elige a los jueces y decide cuántos

Un juez útil combina experiencia en el constructo (por ejemplo, investigación o docencia en el área) con conocimiento del contexto en que aplicarás el instrumento. En una tesis de educación, una combinación razonable es: un académico con trayectoria en la línea del tema, un docente de aula con experiencia en el nivel que estudias y un especialista en metodología de la investigación.
¿Cuántos? No existe una cifra única. Escurra (1988), en su estudio sobre cuantificación de la validez de contenido por criterio de jueces, trabajó con 10 jueces por ítem. Las tablas de probabilidad de Aiken (1985) cubren de 2 a 25 ítems o jueces, con 2 a 7 categorías de calificación, de modo que el número que elijas debe poder interpretarse con la fuente que cites. Pregunta a tu profesor guía cuál es el criterio de tu escuela y justifica tu decisión en el método.
Deja constancia de quiénes fueron los jueces (grado, institución, años de experiencia) en un anexo, y cuida que ninguno sea parte de tu muestra.
Paso 4: Prepara la matriz de evaluación y la carta a los jueces
La matriz es el documento que cada juez completa. Una versión habitual tiene una fila por ítem y columnas por criterio. Estos criterios son comunes en tesis de educación en español; defínelos con precisión en la carta de invitación.
| Criterio | Pregunta al juez | Escala ilustrativa |
|---|---|---|
| Claridad | ¿El ítem se entiende sin ambigüedad para el participante? | 1 a 4 |
| Coherencia | ¿El ítem se relaciona con la dimensión que pretende medir? | 1 a 4 |
| Relevancia | ¿El ítem es importante para medir el constructo? | 1 a 4 |
| Suficiencia | ¿Los ítems de la dimensión bastan para medirla? | 1 a 4, por dimensión |
| Observaciones | ¿Qué cambiarías, agregarías o eliminarías? | Texto libre |
Esa escala de 1 a 4 es ilustrativa; puedes usar otra, siempre que la declares y la mantengas en el cálculo. La carta de invitación debe incluir el título de tu tesis, el objetivo del instrumento, la definición del constructo, la descripción de cada criterio y la fecha en que necesitas la respuesta.
Un ejemplo ilustrativo de ítems para una tesis sobre estrategias didácticas del docente, que un juez evaluaría con la matriz anterior:
- «Mi docente explica los contenidos con ejemplos cercanos a mi realidad.» (dimensión: contextualización)
- «Mi docente me pide aplicar lo aprendido en situaciones nuevas.» (dimensión: transferencia)
- «Mi docente revisa mis trabajos y me devuelve comentarios que me sirven.» (dimensión: retroalimentación)
Estos tres ítems son ficticios y solo ilustran el formato; los tuyos deben derivar de tu definición del constructo y de tus fuentes.
Paso 5: Calcula el acuerdo con la V de Aiken
Aiken (1985), en Educational and Psychological Measurement, 45(1), 131-142, describe tres coeficientes (V, R y H) para analizar la validez y la confiabilidad de calificaciones. Según su resumen, cada coeficiente va de 0 a 1 y se calcula como la razón entre una suma obtenida y una suma máxima de diferencias en las calificaciones. Escurra (1988) comparó el Índice de Acuerdo, la Prueba Binomial y la V de Aiken, y concluyó que la V es el más adecuado porque permite contrastar estadísticamente los valores según el tamaño de la muestra de jueces.
La fórmula habitual para la V de un ítem con calificaciones ordinales es: V = S / [n × (c − 1)], donde S es la suma de las puntuaciones de los jueces después de restar la calificación más baja posible (l) a cada una, n es el número de jueces y c es el número de categorías de la escala. Este es un ejemplo ilustrativo con datos ficticios: 5 jueces, escala de 1 a 4 (c = 4, l = 1), de modo que el máximo posible por ítem es 5 × 3 = 15.
| Ítem | Calificaciones de los 5 jueces | Restando 1 a cada una | S | V = S / 15 |
|---|---|---|---|---|
| Ítem 1 | 4, 4, 3, 4, 4 | 3, 3, 2, 3, 3 | 14 | 0,93 |
| Ítem 2 | 4, 3, 3, 2, 4 | 3, 2, 2, 1, 3 | 11 | 0,73 |
| Ítem 3 | 3, 3, 3, 3, 3 | 2, 2, 2, 2, 2 | 10 | 0,67 |
¿Qué valor es «suficiente»? No uses un corte fijo sin citar de dónde sale. Las tablas de probabilidad de Aiken (1985) permiten saber si una V es estadísticamente significativa para tu número de jueces y de categorías, y Penfield y Giacobbi (2004), en Measurement in Physical Education and Exercise Science, 8(4), 213-225, proponen aplicar un intervalo de confianza basado en la puntuación a este índice. Elige uno de los dos criterios, cítalo y declara qué hiciste con los ítems que no lo cumplen: reformularlos, fusionarlos o eliminarlos.
Otra alternativa que ves en la literatura es la razón de validez de contenido de Lawshe (1975), publicada en Personnel Psychology, 28(4), 563-575, que trabaja con la proporción de jueces que consideran un ítem «esencial». Si tu escuela la prefiere, cita a Lawshe y aplica su procedimiento completo; no mezcles ambos coeficientes sin explicar por qué.
Paso 6: Ajusta los ítems y haz una prueba piloto

Con los resultados en mano, revisa ítem por ítem. Un ítem con baja claridad pero alta relevancia suele necesitar un cambio de redacción, no su eliminación. Registra en una tabla qué comentario hizo cada juez, qué cambiaste y por qué. Esa tabla va como anexo y le muestra a la comisión que el juicio de expertos no fue un trámite.
La prueba piloto es la etapa siguiente: aplicas la versión ajustada a un grupo pequeño de personas con características parecidas a tu muestra, pero que no formarán parte de ella. Con sus respuestas, verificas comprensión de las instrucciones, tiempo de aplicación y funcionamiento de la escala, y calculas un primer coeficiente de confiabilidad. En una escala con varias dimensiones, calcula la confiabilidad de cada una. Después aplicarás el instrumento a tu muestra completa y volverás a calcularla con esos datos.
Cómo reportarlo en el capítulo de método
Ordena el reporte en cinco partes y mantenlo breve:
- Procedimiento: cuántos jueces, con qué perfil, cuándo y cómo recibieron la matriz.
- Criterios evaluados: claridad, coherencia, relevancia y los que hayas usado, con su escala.
- Coeficiente utilizado: V de Aiken, razón de validez de Lawshe u otro, con la fuente que cites y el criterio de decisión.
- Resultados: una tabla con el valor por ítem o por dimensión, y qué ítems se modificaron o eliminaron.
- Piloto y confiabilidad: tamaño del piloto, coeficiente obtenido y decisión final sobre la versión del instrumento.
Para ver cómo encaja este apartado en el resto del método, revisa el marco metodológico de la memoria: enfoque, diseño y alcance. Y si tu tesis es de pedagogía, el ejemplo de tesis de Pedagogía con modelo anotado muestra dónde ubicar la validación dentro de una memoria completa.
Un párrafo modelo, ilustrativo, para tu capítulo: «El instrumento fue sometido a juicio de expertos mediante una matriz de claridad, coherencia y relevancia con escala de 1 a 4. Participaron cinco jueces con grado de magíster o doctor y experiencia en el área. El acuerdo se cuantificó mediante el coeficiente V de Aiken (1985); los ítems con valores inferiores al criterio definido se reformularon según las observaciones de los jueces. Posteriormente se aplicó una prueba piloto a un grupo ajeno a la muestra».
Errores que se pagan caros en la defensa
- Presentar a los jueces sin perfil: «tres expertos» no basta; indica grado, institución y experiencia.
- Calcular la V sin declarar la escala: el valor depende de la escala; sin ella nadie puede interpretarlo.
- Confundir validez de contenido con confiabilidad: el juicio de expertos no reemplaza el alfa de Cronbach ni otro coeficiente.
- Ignorar los comentarios cualitativos: las observaciones de los jueces suelen aportar más que el número.
- Citar la V de Aiken sin abrir a Aiken: cita la fuente original o una revisión que hayas leído.
- Usar jueces de tu entorno cercano que no conocen el constructo: el criterio es pericia, no cercanía.
Preguntas frecuentes
¿Cuántos jueces necesito para la V de Aiken?
No hay una cifra única. Escurra (1988) trabajó con 10 jueces por ítem y las tablas de Aiken (1985) cubren de 2 a 25 jueces o ítems. Consulta el criterio de tu escuela y justifica tu elección en el método.
¿Qué V de Aiken es aceptable?
Depende del número de jueces y de las categorías de tu escala. Usa las tablas de probabilidad de Aiken o el intervalo de confianza de Penfield y Giacobbi, cita la fuente y declara el criterio antes de analizar los resultados.
¿El juicio de expertos reemplaza el alfa de Cronbach?
No. Aporta evidencia de validez de contenido; la confiabilidad es otra propiedad y se calcula con datos de una prueba piloto o de tu muestra.
¿Puedo validar un instrumento ya validado por otros?
Si usas un instrumento publicado sin cambios, cita su evidencia de validez y calcula la confiabilidad con tu muestra. Si lo adaptas, necesitas validar al menos la adaptación con expertos.
¿Puedo ser yo mismo uno de los jueces?
No. El juicio de expertos exige evaluadores independientes del autor del instrumento.
¿Se aplica la V de Aiken a instrumentos cualitativos?
Para guías de entrevista o pautas de observación puedes usar la misma matriz de criterios y calcular acuerdo, aunque algunas escuelas prefieren una validación cualitativa con comentarios. Confírmalo con tu profesor guía.
¿Qué hago si mis jueces no responden a tiempo?
Planifica con holgura: envía la matriz con una fecha límite clara, recuerda a los jueces una vez y ten uno o dos jueces de reserva. Tu cronograma debe incluir esa espera.
Cierra la validación y sigue con tu tesis
Con la matriz, el cálculo y el reporte listos, tu instrumento queda respaldado y puedes avanzar al trabajo de campo. Tesify, la plataforma de inteligencia artificial que acompaña a estudiantes chilenos en su tesis o memoria de título, te ayuda a estructurar el capítulo de método y a ordenar tus anexos, sin reemplazar tus decisiones ni las de tu profesor guía. Más de 9.000 estudiantes y 15.000 capítulos ya se han escrito con Tesify, 100% redactados por cada estudiante con el acompañamiento de la herramienta.
