Cómo hemos evaluado las pruebas de personalidad gratuitas: los criterios de validez
La primera cifra procede del metaanálisis que consolidó la personalidad como predictor legítimo en la selección de personal. Barrick y Mount estimaron una correlación de puntuación verdadera de ρ = 0,22 entre la Conscienciosidad y el rendimiento laboral como media entre tipos de criterio, y ese mismo valor de ρ = 0,22 como media entre cinco grupos ocupacionales doi:10.1111/j.1744-6570.1991.tb00688.x. Conviene saber qué es y qué no es ese dato: es una correlación corregida para un solo rasgo, no para el conjunto del Big Five, y la media observada sin corregir en esa misma tabla es r = 0,13.
La segunda cifra es el listón de fiabilidad con el que debería medirse cualquier instrumento. Gnambs metaanalizó 682 correlaciones test-retest procedentes de 74 muestras (N total = 14.923) recogidas en intervalos de hasta dos meses y obtuvo una estimación mediana de dependabilidad de ρtt = 0,816 para los cinco rasgos doi:10.1016/j.jrp.2014.06.003.
La tercera tarjeta no es un hallazgo de investigación, sino un dato sobre este sitio: el Cèrcol de Cuarto Creciente administra el IPIP-NEO-60, de 60 ítems, y devuelve 30 puntuaciones de faceta sin coste alguno. El instrumento está documentado en Maples-Keller et al. (2019).
Todas las herramientas de esta clasificación se valoran en cinco dimensiones:
- Validación revisada por pares: ¿se ha validado el instrumento de forma independiente en investigación publicada y revisada por pares, y no solo por el proveedor?
- Dominio público o código abierto: ¿pueden inspeccionarse públicamente los ítems y los algoritmos de puntuación, o la metodología es propietaria?
- Fiabilidad test-retest: ¿se mantienen estables las puntuaciones a lo largo de semanas y meses, tal como predice la teoría de la personalidad?
- Validez predictiva: ¿predicen las puntuaciones resultados que importan, como el rendimiento laboral, la eficacia del equipo o el bienestar?
- Uso gratuito: ¿puede usarla un equipo sin costes de licencia por usuario?
Si queréis una introducción a lo que significan estadísticamente estos criterios, leed qué son la fiabilidad y la validez en los tests de personalidad.
Las mejores pruebas de personalidad gratuitas para equipos en 2026, ordenadas por evidencia
1. Evaluaciones basadas en IPIP: la evidencia más sólida, gratuitas y abiertas
Qué mide: las cinco dimensiones del Big Five (Openness, Conscientiousness, Extraversion, Agreeableness, Neuroticism) como puntuaciones continuas y con transparencia a nivel de ítem.
Base científica: el International Personality Item Pool es una biblioteca de dominio público de ítems de personalidad desarrollada por Lewis Goldberg y alojada hoy por el Oregon Research Institute. Las escalas IPIP se construyeron como equivalentes de dominio público de los inventarios comerciales, y esa convergencia está documentada: Johnson informa de que las escalas del IPIP-NEO correlacionaron de media r = 0,73 con las escalas del NEO PI-R en las que se modelaron, y hasta r = 0,94 al corregir la atenuación debida a la falta de fiabilidad de las escalas doi:10.1016/j.jrp.2014.05.003. La propia estructura de cinco factores se replica entre idiomas: McCrae y Costa compararon seis traducciones del NEO PI-R con la estructura factorial estadounidense (N = 7.134, cinco familias lingüísticas distintas) y concluyeron que los datos apuntan con fuerza a que la estructura de los rasgos de personalidad es universal doi:10.1037/0003-066X.52.5.509. Para entender cómo estos ítems se convirtieron en el estándar científico, leed qué es el IPIP y por qué importa e historia del Big Five, de Allport a Goldberg.
Fiabilidad test-retest: alta. La estimación metaanalítica mediana de dependabilidad de las escalas Big Five es de ρtt = 0,816 en intervalos de hasta dos meses, con un error transitorio que explica alrededor del 10 % de la varianza observada en las puntuaciones de rasgo doi:10.1016/j.jrp.2014.06.003.
Validez predictiva para el rendimiento laboral: la evidencia más fuerte de la personalidad en selección de personal se refiere a la Conscienciosidad. Barrick y Mount concluyeron que «una dimensión de la personalidad, la Conscienciosidad, mostró relaciones consistentes con todos los criterios de rendimiento laboral en todos los grupos ocupacionales», con ρ = 0,22 doi:10.1111/j.1744-6570.1991.tb00688.x. En ese mismo análisis, la Extraversión resultó un predictor válido para puestos directivos y comerciales (ρ = 0,18 y 0,15), y tanto la Apertura como la Extraversión predijeron el aprovechamiento de la formación (ρ = 0,25 y 0,26).
Uso gratuito: sí. El IPIP declara que sus ítems y escalas son de dominio público y que pueden copiarse, editarse, traducirse o usarse con cualquier fin sin permiso ni pago.
Preparado para equipos: con una presentación e interpretación adecuadas, sí, aunque administrar el IPIP en bruto exige algo de trabajo previo.
2. Cèrcol: instrumentos IPIP más la evaluación de pares Testigo
Qué mide: las cinco dimensiones del Big Five (aquí Presencia, Vínculo, Visión, Disciplina y Profundidad) mediante autoinforme, más evaluaciones estructuradas de Testigos elegidos por cada participante.
Base científica: está construida directamente sobre ítems IPIP. El Cèrcol de Cuarto Creciente es el IPIP-NEO-60, de 60 ítems, cuyas puntuaciones mostraron buena fiabilidad y validez convergente con el NEO PI-R y el IPIP-NEO-300, y reprodujeron la red nomológica del NEO-FFI en un amplio abanico de variables externas doi:10.1080/00223891.2017.1381968. El Cèrcol de Luna Llena usa el IPIP-NEO-120, de 120 ítems, cuyas propiedades psicométricas, según Johnson, «resisten favorablemente la comparación con las propiedades de la forma más larga» doi:10.1016/j.jrp.2014.05.003. El Cèrcol de Luna Nueva es un cribado de diez ítems basado en el TIPI, que sus autores describen como algo inferior a los instrumentos estándar de múltiples ítems, aunque alcanza niveles adecuados de convergencia y de fiabilidad test-retest doi:10.1016/S0092-6566(03)00046-1. Usadlo como orientación, no como perfil.
La capa de evaluación de pares Testigo añade una segunda perspectiva que el autoinforme por sí solo no puede captar. No es una afirmación blanda: en una integración metaanalítica de 44.178 personas evaluadas en 263 muestras, Connelly y Ones hallaron que, cuando el criterio era el rendimiento académico o el laboral, las valoraciones de terceros arrojaban validez predictiva sustancialmente mayor que la de las autovaloraciones, y además incremental respecto a ellas doi:10.1037/a0021212. En por qué la autoevaluación no basta: el feedback de personalidad entre pares encontraréis la base de evidencia completa.
Fiabilidad test-retest: hereda la estabilidad de la base IPIP del Big Five descrita más arriba.
Validez predictiva: los instrumentos de autoinforme arrastran la validez de las escalas IPIP-NEO que implementan. La capa de Testigos es un diseño de valoración por pares del tipo que Connelly y Ones encontraron que aporta predicción incremental, si bien Cèrcol todavía no ha publicado datos propios de validez de criterio.
Uso gratuito: el Cèrcol de Luna Nueva y el Cèrcol de Cuarto Creciente son gratuitos. El Cèrcol de Luna Llena, que añade el instrumento de 120 ítems y las evaluaciones de Testigo, es una compra de pago único, y es gratuito para las cuentas nuevas mientras dure la beta abierta.
Preparado para equipos: sí, está diseñado específicamente para el uso en equipo. Los resultados incluyen una vista de conjunto que muestra la distribución de los rasgos en el grupo. En qué mide el instrumento Testigo de Cèrcol tenéis la descripción completa del instrumento.
3. Open Source Psychometrics Project
Qué mide: varios instrumentos disponibles de forma gratuita, entre ellos una prueba de Big Five construida con escalas de dominio público del International Personality Item Pool.
Base científica: el Open Source Psychometrics Project aloja instrumentos de personalidad bien documentados y publica los datos brutos anonimizados que hay detrás. Solo su conjunto de datos de los IPIP Big Five Factor Markers reúne 1.015.342 respuestas, y el sitio afirma que sus conjuntos de datos se han usado en más de 25 artículos publicados. Ese grado de transparencia es poco habitual y es la razón principal de que el proyecto figure aquí.
Fiabilidad test-retest: varía según el instrumento; las medidas basadas en IPIP heredan las estimaciones de dependabilidad del Big Five citadas arriba.
Validez predictiva: la aportan las escalas IPIP subyacentes, no está establecida para el sitio en sí.
Uso gratuito: sí, completamente gratuito.
Preparado para equipos: los resultados son individuales; agregarlos en perfiles de equipo exige trabajo adicional. Adecuado para equipos a los que no les incomode interpretar por su cuenta.
4. 16Personalities: popular, con validación independiente limitada
Qué mide: cinco escalas que el proveedor presenta como Energía, Mente, Naturaleza, Tácticas e Identidad, siendo Identidad el eje Asertivo/Turbulento. Las cuatro primeras se comunican con letras al estilo del MBTI, lo que produce 16 tipos con nombre.
Base científica: el proveedor afirma que su NERIS Type Explorer conserva el formato del acrónimo de cuatro letras, pero apoya el modelo en rasgos de cinco factores y no en las funciones cognitivas junguianas. La correspondencia entre las letras y los cinco factores sí se ha estudiado directamente en el caso del MBTI: McCrae y Costa no encontraron «ningún apoyo a la idea de que el MBTI mida preferencias verdaderamente dicotómicas o tipos cualitativamente distintos», si bien los cuatro índices sí medían aspectos de cuatro de las cinco grandes dimensiones de la personalidad normal doi:10.1111/j.1467-6494.1989.tb00759.x. Ahí está el problema de fondo de cualquier salida por tipos: la variación subyacente es continua, y meter a las personas en cajas tira justo la parte de la puntuación que contiene la información. Para esta revisión no se ha localizado ninguna validación independiente revisada por pares del instrumento NERIS en sí. Si queréis el análisis a fondo, leed 16Personalities frente al Big Five: el test viral que acierta a medias.
Fiabilidad test-retest: no establecida en investigación independiente publicada que hayamos podido localizar para este instrumento.
Validez predictiva: tampoco establecida en investigación independiente.
Uso gratuito: sí. El proveedor indica que la prueba es gratuita y no requiere registro.
Preparado para equipos: se usa mucho como rompehielos y arranque de conversación. No debería emplearse para decisiones de alto riesgo sobre roles o desarrollo.
5. MBTI: comercial, y desautorizado para selección por su propia editorial
Qué mide: cuatro dicotomías que dan lugar a un tipo de cuatro letras. La Form M, la forma estándar, tiene 93 ítems de elección forzada.
Base científica: la teoría junguiana de los tipos, operacionalizada por Myers y Briggs. Dos revisiones de Pittenger concluyeron que la literatura disponible no ofrece evidencia suficiente para sostener los postulados de la prueba ni lo que se afirma sobre su utilidad doi:10.3102/00346543063004467, y que el instrumento «puede que todavía no sea capaz de sostener las afirmaciones que hacen sus promotores» doi:10.1037/1065-9293.57.3.210. La síntesis más reciente es más tajante sobre lo que falta: al agregar 193 estudios publicados entre 1999 y 2024, Erford y sus colegas encontraron una consistencia interna de entre 0,845 y 0,921 en las subescalas y las puntuaciones totales, pero señalaron que «los estudios de validez estructural y de test-retest estaban ausentes del muestreo de 25 años de literatura» doi:10.1002/jcad.70006. Un instrumento puede ser internamente consistente y aun así no demostrar que su estructura de cuatro casillas sea real ni que el tipo de una persona se mantenga.
Uso gratuito: no. La Form M se vende a través de distribuidores autorizados, en Canadá a 382 USD el paquete de diez de la versión en papel, y su compra está restringida a personal cualificado.
Preparado para equipos: para conversar, sí. Para seleccionar, la propia editorial dice que no: «La evaluación MBTI nunca debería usarse en reclutamiento ni en selección, porque no mide las habilidades ni las capacidades de una persona».
6. DISC: propietario, con validación independiente limitada
Qué mide: cuatro estilos de conducta (Dominancia, Influencia, Estabilidad y Conscienciosidad), presentados como tipos de cuadrante.
Base científica: la teoría DISC desciende del libro de Marston de 1928 Emotions of Normal People. Marston nunca desarrolló a partir de él una herramienta formal de evaluación; los instrumentos llegaron después y de otras manos, y por eso hoy conviven varias versiones comerciales rivales con ítems, baremos y número de ítems distintos. El trabajo independiente revisado por pares es escaso: el principal intento publicado de relacionar un instrumento de cuatro cuadrantes con uno de cinco factores es una comparación correlacional de Jones y Hartley doi:10.19030/ajbe.v6i4.7945, y para esta revisión no se ha localizado ningún metaanálisis de las puntuaciones DISC frente al rendimiento laboral. La posición que resume la literatura de referencia es que la validez científica de la evaluación DISC no está demostrada. Conviene señalar además que la Conscienciosidad del DISC no significa lo mismo que la Conscientiousness del Big Five. Leed DISC frente al Big Five: por qué cuatro estilos no bastan para una comparación científica detallada, y Big Five frente a DISC frente a Belbin para un cara a cara a tres bandas.
Fiabilidad test-retest: varía según el proveedor y se documenta sobre todo en manuales técnicos de las propias empresas, no en investigación independiente.
Validez predictiva: no establecida para el rendimiento laboral al nivel documentado para los instrumentos Big Five.
Uso gratuito: en parte. Las versiones comerciales más conocidas son propietarias y de pago, pero existen pruebas gratuitas de estilo DISC: Truity, por ejemplo, ofrece una evaluación DISC de 38 ítems con resultados básicos gratuitos y un informe completo de pago opcional. Lo que no es gratuito en ningún caso es la metodología subyacente, que no se publica para su inspección independiente.
Preparado para equipos: muy usado en contextos de formación y eficaz como marco de comunicación. No es apropiado para evaluaciones de alto riesgo.
7. Eneagrama: evidencia mixta, y los nueve tipos son la parte más débil
Qué mide: nueve tipos de personalidad, muy usados en contextos de coaching y de formación espiritual.
Base científica: más débil que la del Big Five, pero el veredicto honesto es «mixta», no «ninguna». Hook y sus colegas revisaron sistemáticamente 104 muestras independientes y encontraron evidencia mixta de fiabilidad y validez: algunos análisis factoriales muestran una alineación parcial con la teoría del Eneagrama, y las subescalas se relacionan con otros constructos, el Big Five incluido, en la dirección que cabría esperar. Los fallos son estructurales. Los análisis factoriales suelen recuperar menos de nueve factores, ningún estudio ha usado técnicas de clasificación por conglomerados para derivar los nueve tipos, y hay poca investigación que respalde las partes secundarias de la teoría, como las alas y los movimientos entre tipos doi:10.1002/jclp.23097. Dicho de otro modo: las partes del Eneagrama que se comportan como rasgos continuos se comportan de forma razonable; lo que no se ha demostrado es la taxonomía de nueve tipos que se levanta sobre ellas. Para más mitos que rodean a las pruebas de personalidad, leed cinco mitos sobre la ciencia de la personalidad que no acaban de morir.
Fiabilidad test-retest: mixta entre los estudios de la revisión sistemática citada.
Validez predictiva: no establecida para el rendimiento laboral.
Uso gratuito: parcialmente; hay versiones gratuitas y también versiones de pago.
Preparado para equipos: puede generar reflexión personal y conversaciones valiosas, pero conviene usarlo como ejercicio reflexivo y no como dato psicométrico.
Pruebas de personalidad gratuitas comparadas: tabla completa de la clasificación de 2026
| Puesto | Herramienta | Evidencia independiente revisada por pares | Dominio abierto | Fiabilidad test-retest | Validez predictiva | Gratuita |
|---|---|---|---|---|---|---|
| 1 | Evaluaciones basadas en IPIP | Sólida | Sí | ρtt ≈ 0,82 en las escalas Big Five | Conscienciosidad ρ = 0,22 para el rendimiento laboral | Sí |
| 2 | Cèrcol | Hereda la evidencia del IPIP | Sí (IPIP) | Hereda la evidencia del IPIP | Hereda la evidencia del IPIP, más las valoraciones de pares | Luna Nueva y Cuarto Creciente gratis, Luna Llena de pago (gratis durante la beta abierta) |
| 3 | Open Source Psychometrics | Sólida para las herramientas IPIP | Sí | Hereda la evidencia del IPIP | Hereda la evidencia del IPIP | Sí |
| 4 | 16Personalities | No localizada | No | No localizada | No localizada | Sí |
| 5 | MBTI | Las revisiones consideran insuficiente la evidencia | No | Ningún estudio de retest en una síntesis de 193 estudios | La editorial descarta su uso en selección | No |
| 6 | DISC | Escasa | No | Documentada por los proveedores | No establecida | Mixta |
| 7 | Eneagrama | Mixta en 104 muestras | Varía | Mixta | No establecida | Parcial |
Cómo elegir la prueba de personalidad gratuita adecuada para vuestro equipo
Para la mayoría de equipos que parten de cero, un enfoque en dos pasos funciona bien:
- Empezad con una autoevaluación gratuita basada en IPIP, ya sea a través de Open Source Psychometrics o del Cèrcol de Cuarto Creciente, para fijar un punto de partida del perfil Big Five de cada persona.
- Añadid la evaluación de pares (Testigos) para ver dónde se separan la percepción propia y la experiencia de los demás. Esa brecha suele ser el terreno de las conversaciones de desarrollo más útiles, y es la parte que cuenta con respaldo metaanalítico doi:10.1037/a0021212.
Si vuestro equipo lleva tiempo usando DISC o 16Personalities como lenguaje común, no hace falta que renunciéis a ese vocabulario. Pero añadir al lado un instrumento Big Five en condiciones os dará la resolución dimensional y la evidencia de validez publicada que a esas herramientas les faltan.
Para profundizar en lo que realmente estáis pagando, o dejando de pagar, al comparar opciones de código abierto y comerciales, leed tests de personalidad: código abierto frente a comercial.
Probad una evaluación de personalidad para equipos gratuita y con fuentes
Cèrcol ocupa el puesto que ocupa porque es una implementación del IPIP, no porque sea nuestra. Los ítems son de dominio público, la puntuación se puede inspeccionar y las cifras de esta página son las que los trabajos citados dicen de verdad.
El Cèrcol de Cuarto Creciente son 60 ítems, se responde en unos diez minutos y devuelve cinco puntuaciones de dimensión y 30 de faceta. El Cèrcol de Luna Nueva es una orientación de diez ítems y dos minutos. La evaluación de pares Testigo, incluida en el Cèrcol de Luna Llena, gratuito para las cuentas nuevas durante la beta abierta, permite invitar hasta a doce personas que os conocen a completar una tarea de adjetivos de elección forzada de cinco minutos. La elección forzada importa por una razón medible: en un metaanálisis sobre evaluación de alto riesgo, las medidas de personalidad de elección forzada mostraron un efecto global de inflación de las puntuaciones de 0,06, muy por debajo de la inflación descrita para las medidas Likert de enunciado único doi:10.1037/apl0000414. Leed cómo aborda Cèrcol el sesgo de deseabilidad social y por qué 120 ítems son mejores que 10 para el porqué del diseño de la medida.
Empezad la evaluación de vuestro equipo en cercol.team. Leed la fundamentación científica para ver exactamente qué estáis midiendo y por qué.
Fuentes
- Barrick, M. R., & Mount, M. K. (1991). The Big Five personality dimensions and job performance: A meta-analysis. Personnel Psychology, 44(1), 1–26. https://doi.org/10.1111/j.1744-6570.1991.tb00688.x
- Gnambs, T. (2014). A meta-analysis of dependability coefficients (test-retest reliabilities) for measures of the Big Five. Journal of Research in Personality, 52, 20–28. https://doi.org/10.1016/j.jrp.2014.06.003
- Johnson, J. A. (2014). Measuring thirty facets of the Five Factor Model with a 120-item public domain inventory: Development of the IPIP-NEO-120. Journal of Research in Personality, 51, 78–89. https://doi.org/10.1016/j.jrp.2014.05.003
- Maples-Keller, J. L., Williamson, R. L., Sleep, C. E., Carter, N. T., Campbell, W. K., & Miller, J. D. (2019). Using item response theory to develop a 60-item representation of the NEO PI-R using the International Personality Item Pool: Development of the IPIP-NEO-60. Journal of Personality Assessment, 101(1), 4–15. https://doi.org/10.1080/00223891.2017.1381968
- Gosling, S. D., Rentfrow, P. J., & Swann, W. B., Jr. (2003). A very brief measure of the Big-Five personality domains. Journal of Research in Personality, 37(6), 504–528. https://doi.org/10.1016/S0092-6566(03)00046-1
- McCrae, R. R., & Costa, P. T. (1997). Personality trait structure as a human universal. American Psychologist, 52(5), 509–516. https://doi.org/10.1037/0003-066X.52.5.509
- McCrae, R. R., & Costa, P. T. (1989). Reinterpreting the Myers-Briggs Type Indicator from the perspective of the five-factor model of personality. Journal of Personality, 57(1), 17–40. https://doi.org/10.1111/j.1467-6494.1989.tb00759.x
- Connelly, B. S., & Ones, D. S. (2010). An other perspective on personality: Meta-analytic integration of observers' accuracy and predictive validity. Psychological Bulletin, 136(6), 1092–1122. https://doi.org/10.1037/a0021212
- Cao, M., & Drasgow, F. (2019). Does forcing reduce faking? A meta-analytic review of forced-choice personality measures in high-stakes situations. Journal of Applied Psychology, 104(11), 1347–1368. https://doi.org/10.1037/apl0000414
- Erford, B. T., Zhang, X., Sweeting, E., Russo, M., Rashid, A., Sherman, M. F., et al. (2025). A 25-year review and psychometric synthesis of the Myers-Briggs Type Indicator (MBTI), Form M. Journal of Counseling and Development, 103(4), 403–417. https://doi.org/10.1002/jcad.70006
- Pittenger, D. J. (1993). The utility of the Myers-Briggs Type Indicator. Review of Educational Research, 63(4), 467–488. https://doi.org/10.3102/00346543063004467
- Pittenger, D. J. (2005). Cautionary comments regarding the Myers-Briggs Type Indicator. Consulting Psychology Journal: Practice and Research, 57(3), 210–221. https://doi.org/10.1037/1065-9293.57.3.210
- Hook, J. N., Hall, T. W., Davis, D. E., Van Tongeren, D. R., & Conner, M. (2021). The Enneagram: A systematic review of the literature and directions for future research. Journal of Clinical Psychology, 77(4), 865–883. https://doi.org/10.1002/jclp.23097
- Jones, C. S., & Hartley, N. T. (2013). Comparing correlations between four-quadrant and five-factor personality assessments. American Journal of Business Education, 6(4), 459–470. https://doi.org/10.19030/ajbe.v6i4.7945
- Marston, W. M. (1928). Emotions of Normal People. Kegan Paul, Trench, Trubner and Co.
- IPIP: International Personality Item Pool, declaración de dominio público y biblioteca de ítems.
- Open Source Psychometrics Project, archivo de datos brutos: https://openpsychometrics.org/_rawdata/
- 16Personalities, página teórica del NERIS Type Explorer: https://www.16personalities.com/articles/our-theory
- The Myers-Briggs Company, recomendación de no usarlo en reclutamiento y selección: https://www.themyersbriggs.com
- Psychometrics Canada, número de ítems y precio del MBTI Step I Form M: https://shop.psychometrics.com
- Truity, prueba de personalidad DISC gratuita: https://www.truity.com/test/disc-personality-test
- Wikipedia: DISC assessment
- Wikipedia: Myers-Briggs Type Indicator
Lecturas adicionales
- MBTI frente al Big Five: ¿cuál debería usar vuestro equipo?
- DISC frente al Big Five: por qué cuatro estilos no bastan
- 16Personalities frente al Big Five: el test viral que acierta a medias
- Qué significan la fiabilidad y la validez en los tests de personalidad
- El sesgo de deseabilidad social en los tests de personalidad
- Cómo se calculan las puntuaciones de un test de personalidad: de los ítems a las dimensiones