Lanzamiento beta: quedan 488 licencias gratuitas de Full Moon. Ayúdanos a detectar errores.
Reclama tu acceso gratuito

Mejores tests de personalidad gratis para equipos en 2026

Hay docenas de tests de personalidad gratuitos y pocos con respaldo científico. Qué herramientas Big Five son válidas en 2026, y cuáles no.

Miquel Matoses·21 min de lectura

El panorama de las evaluaciones de personalidad ha cambiado mucho. Herramientas psicométricas validadas que antes solo existían en entornos académicos o clínicos con licencia hoy están al alcance de cualquiera en línea. Al mismo tiempo, el mercado se ha llenado de evaluaciones de aspecto profesional que se sostienen sobre fundamentos científicos endebles o inexistentes.

Esta clasificación aplica un mismo conjunto de criterios a las pruebas de personalidad para equipos más utilizadas en 2026 y las ordena por la solidez de la evidencia publicada, no por su popularidad. Cada cifra que aparece más abajo se atribuye al trabajo del que procede. Cuando no se ha encontrado ninguna fuente publicada para un dato, el dato no se imprime.

PruebaÍtemsQué muestra la evidencia publicada¿Gratuita?Mejor para
Cèrcol de Cuarto Creciente (IPIP-NEO-60)60Fiabilidad sólida y validez convergente con el NEO PI-REquipos, perfil por facetas
IPIP-NEO-120120Sus propiedades resisten bien la comparación con el IPIP-NEO de 300 ítemsInvestigación, benchmarks de RRHH
TIPI, Big Five de diez ítems10Adecuada, pero psicométricamente mermada por diseñoSolo cribado rápido
MBTI Form M93Consistencia interna alta; ningún estudio de retest ni de validez estructural en una síntesis de 25 añosCoaching de tipos, nunca selección
DISCVaría según el proveedorLa validez científica no está demostradaAlgunos proveedores gratis; las versiones comerciales principales, de pagoRompehielos de taller

Cada fila lleva su fuente en el apartado que la comenta, y todos los trabajos citados figuran en la lista de fuentes del final.


Mírate en cinco dimensiones.

Empieza el test gratis

Cómo hemos evaluado las pruebas de personalidad gratuitas: los criterios de validez

ρ = 0,22 Conscienciosidad y rendimiento laboral: correlación metaanalítica de puntuación verdadera
ρ = 0,816 Mediana de la fiabilidad test-retest a corto plazo de las escalas Big Five
Gratis Cèrcol de Cuarto Creciente: 60 ítems IPIP-NEO, 30 facetas, sin coste

La primera cifra procede del metaanálisis que consolidó la personalidad como predictor legítimo en la selección de personal. Barrick y Mount estimaron una correlación de puntuación verdadera de ρ = 0,22 entre la Conscienciosidad y el rendimiento laboral como media entre tipos de criterio, y ese mismo valor de ρ = 0,22 como media entre cinco grupos ocupacionales doi:10.1111/j.1744-6570.1991.tb00688.x. Conviene saber qué es y qué no es ese dato: es una correlación corregida para un solo rasgo, no para el conjunto del Big Five, y la media observada sin corregir en esa misma tabla es r = 0,13.

La segunda cifra es el listón de fiabilidad con el que debería medirse cualquier instrumento. Gnambs metaanalizó 682 correlaciones test-retest procedentes de 74 muestras (N total = 14.923) recogidas en intervalos de hasta dos meses y obtuvo una estimación mediana de dependabilidad de ρtt = 0,816 para los cinco rasgos doi:10.1016/j.jrp.2014.06.003.

La tercera tarjeta no es un hallazgo de investigación, sino un dato sobre este sitio: el Cèrcol de Cuarto Creciente administra el IPIP-NEO-60, de 60 ítems, y devuelve 30 puntuaciones de faceta sin coste alguno. El instrumento está documentado en Maples-Keller et al. (2019).

Todas las herramientas de esta clasificación se valoran en cinco dimensiones:

  1. Validación revisada por pares: ¿se ha validado el instrumento de forma independiente en investigación publicada y revisada por pares, y no solo por el proveedor?
  2. Dominio público o código abierto: ¿pueden inspeccionarse públicamente los ítems y los algoritmos de puntuación, o la metodología es propietaria?
  3. Fiabilidad test-retest: ¿se mantienen estables las puntuaciones a lo largo de semanas y meses, tal como predice la teoría de la personalidad?
  4. Validez predictiva: ¿predicen las puntuaciones resultados que importan, como el rendimiento laboral, la eficacia del equipo o el bienestar?
  5. Uso gratuito: ¿puede usarla un equipo sin costes de licencia por usuario?

Si queréis una introducción a lo que significan estadísticamente estos criterios, leed qué son la fiabilidad y la validez en los tests de personalidad.


Las mejores pruebas de personalidad gratuitas para equipos en 2026, ordenadas por evidencia

1. Evaluaciones basadas en IPIP: la evidencia más sólida, gratuitas y abiertas

Qué mide: las cinco dimensiones del Big Five (Openness, Conscientiousness, Extraversion, Agreeableness, Neuroticism) como puntuaciones continuas y con transparencia a nivel de ítem.

Base científica: el International Personality Item Pool es una biblioteca de dominio público de ítems de personalidad desarrollada por Lewis Goldberg y alojada hoy por el Oregon Research Institute. Las escalas IPIP se construyeron como equivalentes de dominio público de los inventarios comerciales, y esa convergencia está documentada: Johnson informa de que las escalas del IPIP-NEO correlacionaron de media r = 0,73 con las escalas del NEO PI-R en las que se modelaron, y hasta r = 0,94 al corregir la atenuación debida a la falta de fiabilidad de las escalas doi:10.1016/j.jrp.2014.05.003. La propia estructura de cinco factores se replica entre idiomas: McCrae y Costa compararon seis traducciones del NEO PI-R con la estructura factorial estadounidense (N = 7.134, cinco familias lingüísticas distintas) y concluyeron que los datos apuntan con fuerza a que la estructura de los rasgos de personalidad es universal doi:10.1037/0003-066X.52.5.509. Para entender cómo estos ítems se convirtieron en el estándar científico, leed qué es el IPIP y por qué importa e historia del Big Five, de Allport a Goldberg.

Fiabilidad test-retest: alta. La estimación metaanalítica mediana de dependabilidad de las escalas Big Five es de ρtt = 0,816 en intervalos de hasta dos meses, con un error transitorio que explica alrededor del 10 % de la varianza observada en las puntuaciones de rasgo doi:10.1016/j.jrp.2014.06.003.

Validez predictiva para el rendimiento laboral: la evidencia más fuerte de la personalidad en selección de personal se refiere a la Conscienciosidad. Barrick y Mount concluyeron que «una dimensión de la personalidad, la Conscienciosidad, mostró relaciones consistentes con todos los criterios de rendimiento laboral en todos los grupos ocupacionales», con ρ = 0,22 doi:10.1111/j.1744-6570.1991.tb00688.x. En ese mismo análisis, la Extraversión resultó un predictor válido para puestos directivos y comerciales (ρ = 0,18 y 0,15), y tanto la Apertura como la Extraversión predijeron el aprovechamiento de la formación (ρ = 0,25 y 0,26).

Uso gratuito: sí. El IPIP declara que sus ítems y escalas son de dominio público y que pueden copiarse, editarse, traducirse o usarse con cualquier fin sin permiso ni pago.

Preparado para equipos: con una presentación e interpretación adecuadas, sí, aunque administrar el IPIP en bruto exige algo de trabajo previo.


2. Cèrcol: instrumentos IPIP más la evaluación de pares Testigo

Qué mide: las cinco dimensiones del Big Five (aquí Presencia, Vínculo, Visión, Disciplina y Profundidad) mediante autoinforme, más evaluaciones estructuradas de Testigos elegidos por cada participante.

Base científica: está construida directamente sobre ítems IPIP. El Cèrcol de Cuarto Creciente es el IPIP-NEO-60, de 60 ítems, cuyas puntuaciones mostraron buena fiabilidad y validez convergente con el NEO PI-R y el IPIP-NEO-300, y reprodujeron la red nomológica del NEO-FFI en un amplio abanico de variables externas doi:10.1080/00223891.2017.1381968. El Cèrcol de Luna Llena usa el IPIP-NEO-120, de 120 ítems, cuyas propiedades psicométricas, según Johnson, «resisten favorablemente la comparación con las propiedades de la forma más larga» doi:10.1016/j.jrp.2014.05.003. El Cèrcol de Luna Nueva es un cribado de diez ítems basado en el TIPI, que sus autores describen como algo inferior a los instrumentos estándar de múltiples ítems, aunque alcanza niveles adecuados de convergencia y de fiabilidad test-retest doi:10.1016/S0092-6566(03)00046-1. Usadlo como orientación, no como perfil.

La capa de evaluación de pares Testigo añade una segunda perspectiva que el autoinforme por sí solo no puede captar. No es una afirmación blanda: en una integración metaanalítica de 44.178 personas evaluadas en 263 muestras, Connelly y Ones hallaron que, cuando el criterio era el rendimiento académico o el laboral, las valoraciones de terceros arrojaban validez predictiva sustancialmente mayor que la de las autovaloraciones, y además incremental respecto a ellas doi:10.1037/a0021212. En por qué la autoevaluación no basta: el feedback de personalidad entre pares encontraréis la base de evidencia completa.

Fiabilidad test-retest: hereda la estabilidad de la base IPIP del Big Five descrita más arriba.

Validez predictiva: los instrumentos de autoinforme arrastran la validez de las escalas IPIP-NEO que implementan. La capa de Testigos es un diseño de valoración por pares del tipo que Connelly y Ones encontraron que aporta predicción incremental, si bien Cèrcol todavía no ha publicado datos propios de validez de criterio.

Uso gratuito: el Cèrcol de Luna Nueva y el Cèrcol de Cuarto Creciente son gratuitos. El Cèrcol de Luna Llena, que añade el instrumento de 120 ítems y las evaluaciones de Testigo, es una compra de pago único, y es gratuito para las cuentas nuevas mientras dure la beta abierta.

Preparado para equipos: sí, está diseñado específicamente para el uso en equipo. Los resultados incluyen una vista de conjunto que muestra la distribución de los rasgos en el grupo. En qué mide el instrumento Testigo de Cèrcol tenéis la descripción completa del instrumento.


3. Open Source Psychometrics Project

Qué mide: varios instrumentos disponibles de forma gratuita, entre ellos una prueba de Big Five construida con escalas de dominio público del International Personality Item Pool.

Base científica: el Open Source Psychometrics Project aloja instrumentos de personalidad bien documentados y publica los datos brutos anonimizados que hay detrás. Solo su conjunto de datos de los IPIP Big Five Factor Markers reúne 1.015.342 respuestas, y el sitio afirma que sus conjuntos de datos se han usado en más de 25 artículos publicados. Ese grado de transparencia es poco habitual y es la razón principal de que el proyecto figure aquí.

Fiabilidad test-retest: varía según el instrumento; las medidas basadas en IPIP heredan las estimaciones de dependabilidad del Big Five citadas arriba.

Validez predictiva: la aportan las escalas IPIP subyacentes, no está establecida para el sitio en sí.

Uso gratuito: sí, completamente gratuito.

Preparado para equipos: los resultados son individuales; agregarlos en perfiles de equipo exige trabajo adicional. Adecuado para equipos a los que no les incomode interpretar por su cuenta.


Qué mide: cinco escalas que el proveedor presenta como Energía, Mente, Naturaleza, Tácticas e Identidad, siendo Identidad el eje Asertivo/Turbulento. Las cuatro primeras se comunican con letras al estilo del MBTI, lo que produce 16 tipos con nombre.

Base científica: el proveedor afirma que su NERIS Type Explorer conserva el formato del acrónimo de cuatro letras, pero apoya el modelo en rasgos de cinco factores y no en las funciones cognitivas junguianas. La correspondencia entre las letras y los cinco factores sí se ha estudiado directamente en el caso del MBTI: McCrae y Costa no encontraron «ningún apoyo a la idea de que el MBTI mida preferencias verdaderamente dicotómicas o tipos cualitativamente distintos», si bien los cuatro índices sí medían aspectos de cuatro de las cinco grandes dimensiones de la personalidad normal doi:10.1111/j.1467-6494.1989.tb00759.x. Ahí está el problema de fondo de cualquier salida por tipos: la variación subyacente es continua, y meter a las personas en cajas tira justo la parte de la puntuación que contiene la información. Para esta revisión no se ha localizado ninguna validación independiente revisada por pares del instrumento NERIS en sí. Si queréis el análisis a fondo, leed 16Personalities frente al Big Five: el test viral que acierta a medias.

Fiabilidad test-retest: no establecida en investigación independiente publicada que hayamos podido localizar para este instrumento.

Validez predictiva: tampoco establecida en investigación independiente.

Uso gratuito: sí. El proveedor indica que la prueba es gratuita y no requiere registro.

Preparado para equipos: se usa mucho como rompehielos y arranque de conversación. No debería emplearse para decisiones de alto riesgo sobre roles o desarrollo.


5. MBTI: comercial, y desautorizado para selección por su propia editorial

Qué mide: cuatro dicotomías que dan lugar a un tipo de cuatro letras. La Form M, la forma estándar, tiene 93 ítems de elección forzada.

Base científica: la teoría junguiana de los tipos, operacionalizada por Myers y Briggs. Dos revisiones de Pittenger concluyeron que la literatura disponible no ofrece evidencia suficiente para sostener los postulados de la prueba ni lo que se afirma sobre su utilidad doi:10.3102/00346543063004467, y que el instrumento «puede que todavía no sea capaz de sostener las afirmaciones que hacen sus promotores» doi:10.1037/1065-9293.57.3.210. La síntesis más reciente es más tajante sobre lo que falta: al agregar 193 estudios publicados entre 1999 y 2024, Erford y sus colegas encontraron una consistencia interna de entre 0,845 y 0,921 en las subescalas y las puntuaciones totales, pero señalaron que «los estudios de validez estructural y de test-retest estaban ausentes del muestreo de 25 años de literatura» doi:10.1002/jcad.70006. Un instrumento puede ser internamente consistente y aun así no demostrar que su estructura de cuatro casillas sea real ni que el tipo de una persona se mantenga.

Uso gratuito: no. La Form M se vende a través de distribuidores autorizados, en Canadá a 382 USD el paquete de diez de la versión en papel, y su compra está restringida a personal cualificado.

Preparado para equipos: para conversar, sí. Para seleccionar, la propia editorial dice que no: «La evaluación MBTI nunca debería usarse en reclutamiento ni en selección, porque no mide las habilidades ni las capacidades de una persona».


6. DISC: propietario, con validación independiente limitada

Qué mide: cuatro estilos de conducta (Dominancia, Influencia, Estabilidad y Conscienciosidad), presentados como tipos de cuadrante.

Base científica: la teoría DISC desciende del libro de Marston de 1928 Emotions of Normal People. Marston nunca desarrolló a partir de él una herramienta formal de evaluación; los instrumentos llegaron después y de otras manos, y por eso hoy conviven varias versiones comerciales rivales con ítems, baremos y número de ítems distintos. El trabajo independiente revisado por pares es escaso: el principal intento publicado de relacionar un instrumento de cuatro cuadrantes con uno de cinco factores es una comparación correlacional de Jones y Hartley doi:10.19030/ajbe.v6i4.7945, y para esta revisión no se ha localizado ningún metaanálisis de las puntuaciones DISC frente al rendimiento laboral. La posición que resume la literatura de referencia es que la validez científica de la evaluación DISC no está demostrada. Conviene señalar además que la Conscienciosidad del DISC no significa lo mismo que la Conscientiousness del Big Five. Leed DISC frente al Big Five: por qué cuatro estilos no bastan para una comparación científica detallada, y Big Five frente a DISC frente a Belbin para un cara a cara a tres bandas.

Fiabilidad test-retest: varía según el proveedor y se documenta sobre todo en manuales técnicos de las propias empresas, no en investigación independiente.

Validez predictiva: no establecida para el rendimiento laboral al nivel documentado para los instrumentos Big Five.

Uso gratuito: en parte. Las versiones comerciales más conocidas son propietarias y de pago, pero existen pruebas gratuitas de estilo DISC: Truity, por ejemplo, ofrece una evaluación DISC de 38 ítems con resultados básicos gratuitos y un informe completo de pago opcional. Lo que no es gratuito en ningún caso es la metodología subyacente, que no se publica para su inspección independiente.

Preparado para equipos: muy usado en contextos de formación y eficaz como marco de comunicación. No es apropiado para evaluaciones de alto riesgo.


7. Eneagrama: evidencia mixta, y los nueve tipos son la parte más débil

Qué mide: nueve tipos de personalidad, muy usados en contextos de coaching y de formación espiritual.

Base científica: más débil que la del Big Five, pero el veredicto honesto es «mixta», no «ninguna». Hook y sus colegas revisaron sistemáticamente 104 muestras independientes y encontraron evidencia mixta de fiabilidad y validez: algunos análisis factoriales muestran una alineación parcial con la teoría del Eneagrama, y las subescalas se relacionan con otros constructos, el Big Five incluido, en la dirección que cabría esperar. Los fallos son estructurales. Los análisis factoriales suelen recuperar menos de nueve factores, ningún estudio ha usado técnicas de clasificación por conglomerados para derivar los nueve tipos, y hay poca investigación que respalde las partes secundarias de la teoría, como las alas y los movimientos entre tipos doi:10.1002/jclp.23097. Dicho de otro modo: las partes del Eneagrama que se comportan como rasgos continuos se comportan de forma razonable; lo que no se ha demostrado es la taxonomía de nueve tipos que se levanta sobre ellas. Para más mitos que rodean a las pruebas de personalidad, leed cinco mitos sobre la ciencia de la personalidad que no acaban de morir.

Fiabilidad test-retest: mixta entre los estudios de la revisión sistemática citada.

Validez predictiva: no establecida para el rendimiento laboral.

Uso gratuito: parcialmente; hay versiones gratuitas y también versiones de pago.

Preparado para equipos: puede generar reflexión personal y conversaciones valiosas, pero conviene usarlo como ejercicio reflexivo y no como dato psicométrico.


Pruebas de personalidad gratuitas comparadas: tabla completa de la clasificación de 2026

PuestoHerramientaEvidencia independiente revisada por paresDominio abiertoFiabilidad test-retestValidez predictivaGratuita
1Evaluaciones basadas en IPIPSólidaρtt ≈ 0,82 en las escalas Big FiveConscienciosidad ρ = 0,22 para el rendimiento laboral
2CèrcolHereda la evidencia del IPIPSí (IPIP)Hereda la evidencia del IPIPHereda la evidencia del IPIP, más las valoraciones de paresLuna Nueva y Cuarto Creciente gratis, Luna Llena de pago (gratis durante la beta abierta)
3Open Source PsychometricsSólida para las herramientas IPIPHereda la evidencia del IPIPHereda la evidencia del IPIP
416PersonalitiesNo localizadaNoNo localizadaNo localizada
5MBTILas revisiones consideran insuficiente la evidenciaNoNingún estudio de retest en una síntesis de 193 estudiosLa editorial descarta su uso en selecciónNo
6DISCEscasaNoDocumentada por los proveedoresNo establecidaMixta
7EneagramaMixta en 104 muestrasVaríaMixtaNo establecidaParcial

Cómo elegir la prueba de personalidad gratuita adecuada para vuestro equipo

Para la mayoría de equipos que parten de cero, un enfoque en dos pasos funciona bien:

  1. Empezad con una autoevaluación gratuita basada en IPIP, ya sea a través de Open Source Psychometrics o del Cèrcol de Cuarto Creciente, para fijar un punto de partida del perfil Big Five de cada persona.
  2. Añadid la evaluación de pares (Testigos) para ver dónde se separan la percepción propia y la experiencia de los demás. Esa brecha suele ser el terreno de las conversaciones de desarrollo más útiles, y es la parte que cuenta con respaldo metaanalítico doi:10.1037/a0021212.

Si vuestro equipo lleva tiempo usando DISC o 16Personalities como lenguaje común, no hace falta que renunciéis a ese vocabulario. Pero añadir al lado un instrumento Big Five en condiciones os dará la resolución dimensional y la evidencia de validez publicada que a esas herramientas les faltan.

Para profundizar en lo que realmente estáis pagando, o dejando de pagar, al comparar opciones de código abierto y comerciales, leed tests de personalidad: código abierto frente a comercial.


Probad una evaluación de personalidad para equipos gratuita y con fuentes

Cèrcol ocupa el puesto que ocupa porque es una implementación del IPIP, no porque sea nuestra. Los ítems son de dominio público, la puntuación se puede inspeccionar y las cifras de esta página son las que los trabajos citados dicen de verdad.

El Cèrcol de Cuarto Creciente son 60 ítems, se responde en unos diez minutos y devuelve cinco puntuaciones de dimensión y 30 de faceta. El Cèrcol de Luna Nueva es una orientación de diez ítems y dos minutos. La evaluación de pares Testigo, incluida en el Cèrcol de Luna Llena, gratuito para las cuentas nuevas durante la beta abierta, permite invitar hasta a doce personas que os conocen a completar una tarea de adjetivos de elección forzada de cinco minutos. La elección forzada importa por una razón medible: en un metaanálisis sobre evaluación de alto riesgo, las medidas de personalidad de elección forzada mostraron un efecto global de inflación de las puntuaciones de 0,06, muy por debajo de la inflación descrita para las medidas Likert de enunciado único doi:10.1037/apl0000414. Leed cómo aborda Cèrcol el sesgo de deseabilidad social y por qué 120 ítems son mejores que 10 para el porqué del diseño de la medida.

Empezad la evaluación de vuestro equipo en cercol.team. Leed la fundamentación científica para ver exactamente qué estáis midiendo y por qué.

Fuentes

Lecturas adicionales

Cèrcol

Mírate en cinco dimensiones.

Sesenta ítems, unos diez minutos. Cinco dimensiones y 30 facetas. Gratis, sin cuenta.

Empieza el test de 60 ítemsVer un informe de ejemplo

Artículos relacionados

Cèrcol usa solo cookies funcionales, sin analíticas, sin rastreadores publicitarios. Política de privacidad