Com hem avaluat les proves de personalitat gratuïtes: els criteris de validesa
La primera xifra prové de la metaanàlisi que va establir la personalitat com a predictor legítim en la selecció de personal. Barrick i Mount van informar d'una correlació de puntuació veritable estimada de ρ = 0,22 entre la Responsabilitat (Conscientiousness) i el rendiment laboral com a mitjana entre tipus de criteri, i del mateix ρ = 0,22 com a mitjana entre cinc grups ocupacionals doi:10.1111/j.1744-6570.1991.tb00688.x. Fixa't en què és aquest valor i què no és: és una correlació corregida per a un sol tret, no per al Big Five com a conjunt, i la mitjana observada sense corregir de la mateixa taula és r = 0,13.
La segona xifra és el llistó de fiabilitat amb què cal comparar qualsevol instrument. Gnambs va fer una metaanàlisi de 682 correlacions test-retest procedents de 74 mostres (N total = 14.923) recollides en intervals de fins a dos mesos, i va informar d'una estimació mediana de dependabilitat de ρtt = 0,816 per als cinc trets doi:10.1016/j.jrp.2014.06.003.
La tercera targeta és un fet sobre aquest lloc, no un resultat de recerca: el Cèrcol de Quart Creixent administra l'IPIP-NEO-60, de 60 ítems, i retorna 30 puntuacions de faceta sense cap cost. L'instrument està documentat a Maples-Keller et al. (2019).
Cada eina d'aquesta classificació s'avalua en cinc dimensions:
- Validació revisada per iguals: ha estat validat l'instrument de manera independent en recerca publicada i revisada per iguals, i no només pel proveïdor?
- Domini públic / codi obert: són els ítems i els algorismes de puntuació inspeccionables públicament, o la metodologia és propietària?
- Fiabilitat test-retest: les puntuacions es mantenen estables al llarg de setmanes i mesos, tal com prediu la teoria de la personalitat?
- Validesa predictiva: les puntuacions prediuen resultats que importen, rendiment laboral, efectivitat de l'equip, benestar?
- Ús gratuït: pot un equip usar-la sense costos de llicència per usuari?
Per a una introducció al que signifiquen estadísticament aquests criteris, consulta què són la fiabilitat i la validesa en els tests de personalitat.
Les millors proves de personalitat gratuïtes per a equips el 2026, classificades per ciència
1. Avaluacions basades en IPIP: l'evidència més sòlida, gratuïtes i obertes
Què mesura: les cinc dimensions del Big Five (Openness, Conscientiousness, Extraversion, Agreeableness, Neuroticism) com a puntuacions contínues, amb transparència ítem per ítem.
Base científica: l'International Personality Item Pool és una biblioteca de domini públic d'ítems de personalitat desenvolupada per Lewis Goldberg i allotjada ara per l'Oregon Research Institute. Les escales IPIP es van construir com a equivalents de domini públic dels inventaris comercials, i la convergència està documentada: Johnson informa que les escales IPIP-NEO van correlacionar de mitjana r = 0,73 amb les escales del NEO PI-R en què es van modelar, i que la xifra puja fins a r = 0,94 quan es corregeix l'atenuació deguda a la manca de fiabilitat de les escales doi:10.1016/j.jrp.2014.05.003. L'estructura de cinc factors en si mateixa es replica entre llengües: McCrae i Costa van comparar sis traduccions del NEO PI-R amb l'estructura factorial nord-americana (N = 7.134, cinc famílies lingüístiques diferents) i van concloure que les dades suggereixen amb força que l'estructura dels trets de personalitat és universal doi:10.1037/0003-066X.52.5.509. Per entendre com aquests ítems es van convertir en l'estàndard científic, consulta què és l'IPIP i per què importa i història del Big Five, d'Allport a Goldberg.
Fiabilitat test-retest: alta. L'estimació mediana metaanalítica de dependabilitat de les escales Big Five és ρtt = 0,816 en intervals de fins a dos mesos, i l'error transitori explica al voltant del 10 % de la variància observada en les puntuacions de trets doi:10.1016/j.jrp.2014.06.003.
Validesa predictiva per al rendiment laboral: l'evidència de personalitat més sòlida en selecció de personal té a veure amb la Responsabilitat. Barrick i Mount van concloure que «una dimensió de la personalitat, la Responsabilitat, va mostrar relacions consistents amb tots els criteris de rendiment laboral en tots els grups ocupacionals», amb ρ = 0,22 doi:10.1111/j.1744-6570.1991.tb00688.x. En la mateixa anàlisi, l'Extraversió era un predictor vàlid per a rols directius i comercials (ρ = 0,18 i 0,15), i tant l'Obertura com l'Extraversió predeien la competència en formació (ρ = 0,25 i 0,26).
Ús gratuït: sí. L'IPIP declara que els seus ítems i escales són de domini públic i que es poden copiar, editar, traduir o utilitzar amb qualsevol finalitat sense permís ni cost.
Preparat per a equips: amb una presentació i una interpretació adequades, sí, però administrar l'IPIP en brut requereix una mica de configuració.
2. Cèrcol: instruments IPIP més l'avaluació d'iguals Testimoni
Què mesura: les cinc dimensions del Big Five (com a Presència, Vincle, Visió, Disciplina i Profunditat) mitjançant autoinforme, més avaluacions estructurades de Testimonis triats per cada participant.
Base científica: construïda directament sobre ítems IPIP. El Cèrcol de Quart Creixent és l'IPIP-NEO-60, de 60 ítems, les puntuacions del qual van mostrar bona fiabilitat i validesa convergent amb el NEO PI-R i l'IPIP-NEO-300, i van reproduir la xarxa nomològica del NEO-FFI en un ampli ventall de variables externes doi:10.1080/00223891.2017.1381968. El Cèrcol de Lluna Plena utilitza l'IPIP-NEO-120, de 120 ítems, les propietats psicomètriques del qual, segons Johnson, «resisteixen bé la comparació amb les propietats de la forma llarga» doi:10.1016/j.jrp.2014.05.003. El Cèrcol de Lluna Nova és un cribratge de deu ítems basat en el TIPI, que els seus autors descriuen com una mica inferior als instruments estàndard de múltiples ítems, tot i que arriba a nivells adequats de convergència i de fiabilitat test-retest doi:10.1016/S0092-6566(03)00046-1. Utilitza'l com a orientació, no com a perfil.
La capa d'avaluació d'iguals Testimoni hi afegeix una segona perspectiva que l'autoinforme tot sol no pot captar. No és una afirmació vaga: en una integració metaanalítica de 44.178 persones avaluades en 263 mostres, Connelly i Ones van trobar que, quan el criteri era el rendiment acadèmic o el laboral, les valoracions d'altres persones donaven validesa predictiva substancialment superior a la de les autovaloracions, i incremental respecte d'aquestes doi:10.1037/a0021212. Consulta per què l'autoavaluació sola no és suficient: valoració de personalitat entre iguals per a la base d'evidència més àmplia.
Fiabilitat test-retest: hereta l'estabilitat de la base IPIP Big Five descrita més amunt.
Validesa predictiva: els instruments d'autoinforme porten la validesa de les escales IPIP-NEO que implementen. La capa de Testimoni és un disseny de valoració entre iguals com els que Connelly i Ones van trobar que afegeixen predicció incremental, tot i que Cèrcol encara no ha publicat dades pròpies de validesa de criteri.
Ús gratuït: el Cèrcol de Lluna Nova i el Cèrcol de Quart Creixent són gratuïts. El Cèrcol de Lluna Plena, que hi afegeix l'instrument de 120 ítems i les avaluacions de Testimoni, és una compra de pagament única, i és gratuït per als comptes nous mentre dure la beta oberta.
Preparat per a equips: sí, dissenyat específicament per a l'ús en equips. Els resultats inclouen una vista de conjunt de l'equip que mostra la distribució dels trets dins del grup. Consulta què mesura l'instrument Testimoni de Cèrcol per a la descripció completa de l'instrument.
3. Open Source Psychometrics Project
Què mesura: diversos instruments disponibles gratuïtament, entre ells una prova Big Five construïda amb escales de domini públic de l'International Personality Item Pool.
Base científica: l'Open Source Psychometrics Project allotja instruments de personalitat ben documentats i publica les dades de resposta anonimitzades que hi ha al darrere. Només el conjunt de dades dels IPIP Big Five Factor Markers conté 1.015.342 respostes, i el lloc afirma que els seus conjunts de dades s'han utilitzat en més de 25 articles publicats. Aquest grau de transparència és poc habitual i és el motiu principal pel qual el projecte apareix en aquesta posició.
Fiabilitat test-retest: varia segons l'instrument; les mesures basades en IPIP hereten les estimacions de dependabilitat del Big Five indicades més amunt.
Validesa predictiva: la porten les escales IPIP subjacents; no està establerta per al lloc en si.
Ús gratuït: sí, completament gratuït.
Preparat per a equips: els resultats són individuals; agregar-los en perfils d'equip requereix treball addicional. Adequat per a equips còmodes amb una certa interpretació autogestionada.
4. 16Personalities: popular, amb poca validació independent
Què mesura: cinc escales, que el proveïdor presenta com a Energia, Ment, Naturalesa, Tàctiques i Identitat, on Identitat és l'eix Assertiu/Turbulent. Les quatre primeres es presenten amb lletres a l'estil del MBTI i generen 16 tipus amb nom.
Base científica: el proveïdor afirma que el seu NERIS Type Explorer manté el format d'acrònim de quatre lletres, però basa el model en trets de cinc factors i no en les funcions cognitives junguianes. La correspondència entre les lletres i els cinc factors s'ha estudiat directament per al MBTI: McCrae i Costa no van trobar «cap suport per a la idea que el MBTI mesura preferències realment dicotòmiques o tipus qualitativament diferents», encara que els quatre índexs sí que mesuraven aspectes de quatre de les cinc grans dimensions de la personalitat normal doi:10.1111/j.1467-6494.1989.tb00759.x. Aquest és el problema de fons de qualsevol resultat en forma de tipus: la variació subjacent és contínua, i encaixar les persones en caselles llença la part de la puntuació que porta la informació. Per a aquesta revisió no s'ha trobat cap validació independent revisada per iguals del mateix instrument NERIS. Per a un desglossament exhaustiu, consulta 16Personalities vs Big Five: la prova viral que encerta a mitges.
Fiabilitat test-retest: no establerta. Per a aquest instrument no s'ha pogut localitzar recerca independent publicada.
Validesa predictiva: tampoc no està establerta en recerca independent.
Ús gratuït: sí. El proveïdor afirma que la prova és gratuïta i que no requereix registre.
Preparat per a equips: molt utilitzat com a trencaglaços i inici de conversa. No s'hauria d'utilitzar per a decisions d'alt risc sobre rols o desenvolupament.
5. MBTI: comercial, i desautoritzat per a la selecció pel seu propi editor
Què mesura: quatre dicotomies que donen un tipus de quatre lletres. La Form M, la forma estàndard, té 93 ítems de selecció forçada.
Base científica: la teoria dels tipus de Jung, operacionalitzada per Myers i Briggs. Dues revisions de Pittenger van concloure que la literatura disponible no ofereix prou evidència per sostenir els postulats de la prova ni les afirmacions sobre la utilitat que se li atribueix doi:10.3102/00346543063004467, i que l'instrument «potser encara no pot sostenir les afirmacions que en fan els seus promotors» doi:10.1037/1065-9293.57.3.210. La síntesi més recent és més contundent sobre el que falta: agregant 193 estudis publicats entre 1999 i 2024, Erford i col·legues van trobar una consistència interna de 0,845 a 0,921 entre subescales i puntuacions totals, però van informar que «els estudis de validesa estructural i de test-retest eren absents de la mostra de literatura de 25 anys» doi:10.1002/jcad.70006. Un instrument pot ser internament consistent i, tot i així, no arribar a demostrar que l'estructura de quatre caselles és real ni que el tipus d'una persona es manté estable.
Ús gratuït: no. La Form M es ven a través de distribuïdors amb llicència, al Canadà a 382 USD el paquet de deu per a la versió en paper, i està restringida a compradors qualificats.
Preparat per a equips: per a la discussió, sí. Per a la selecció, el mateix editor diu que no: «L'avaluació MBTI no s'hauria d'utilitzar mai en reclutament o selecció, perquè no mesura les habilitats ni les capacitats d'una persona.»
6. DISC: propietari, amb poca validació independent
Què mesura: quatre estils de comportament (Dominància, Influència, Estabilitat, Conscientiousness), presentats com a tipus de quadrant.
Base científica: la teoria DISC descendeix del llibre de Marston de 1928, Emotions of Normal People. Marston no en va desenvolupar mai cap eina d'avaluació formal; els instruments van arribar després i d'altres mans, i per això ara existeixen diverses versions comercials competidores amb ítems diferents, normes diferents i nombres d'ítems diferents. El treball independent revisat per iguals és escàs: el principal intent publicat de relacionar un instrument de quatre quadrants amb un instrument de cinc factors és una comparació correlacional de Jones i Hartley doi:10.19030/ajbe.v6i4.7945, i per a aquesta revisió no s'ha localitzat cap metaanàlisi de puntuacions DISC contra el rendiment laboral. La posició resumida a la literatura de referència és que la validesa científica de l'avaluació DISC no s'ha demostrat. Tingues en compte també que l'etiqueta Conscientiousness del DISC no vol dir el mateix que Conscientiousness en el Big Five. Consulta DISC vs Big Five: per què quatre estils no són suficients per a una comparació científica detallada, i Big Five vs DISC vs Belbin per a un cara a cara de tres bandes.
Fiabilitat test-retest: varia segons el proveïdor i es publica sobretot en manuals tècnics dels proveïdors, no en recerca independent.
Validesa predictiva: no establerta per al rendiment laboral al nivell documentat per als instruments Big Five.
Ús gratuït: parcialment. Les versions comercials més conegudes són propietàries i de pagament, però existeixen proves d'estil DISC gratuïtes: Truity, per exemple, ofereix una avaluació DISC de 38 ítems amb resultats bàsics gratuïts i un informe complet de pagament opcional. El que no és gratuït enlloc és la metodologia subjacent, que no es publica per a una inspecció independent.
Preparat per a equips: molt utilitzat en contextos de formació; efectiu com a marc de comunicació. No és apropiat per a una avaluació d'alt risc.
7. Eneagrama: evidència mixta, i els nou tipus són la part més feble
Què mesura: nou tipus de personalitat, molt utilitzats en contextos de coaching i de formació espiritual.
Base científica: més feble que la del Big Five, però el veredicte honest és «mixta», no «cap». Hook i col·legues van revisar sistemàticament 104 mostres independents i van trobar evidència mixta de fiabilitat i validesa: alguns treballs d'anàlisi factorial mostren un alineament parcial amb la teoria de l'Eneagrama, i les subescales es relacionen amb altres constructes, el Big Five inclòs, de manera coherent amb la teoria. Les mancances són estructurals. Les anàlisis factorials solen recuperar menys de nou factors, cap estudi no ha utilitzat tècniques d'agrupament per derivar els nou tipus, i les parts secundàries de la teoria, com les ales i el moviment entre tipus, tenen molt poca recerca al darrere doi:10.1002/jclp.23097. Dit d'una altra manera: les parts de l'Eneagrama que es comporten com a trets continus es comporten raonablement; la taxonomia de nou tipus que s'hi superposa és la part que no s'ha demostrat. Per a més informació sobre els mites que envolten les proves de personalitat, consulta cinc mites de la ciència de la personalitat que no moren mai.
Fiabilitat test-retest: mixta entre estudis, segons la revisió sistemàtica esmentada.
Validesa predictiva: no establerta per al rendiment laboral.
Ús gratuït: parcialment; algunes versions són gratuïtes i n'existeixen de pagament.
Preparat per a equips: pot generar reflexió personal i discussió significatives, però s'hauria d'utilitzar com a exercici reflexiu, no com a dades psicomètriques.
Proves de personalitat gratuïtes comparades: taula de classificació completa 2026
| Rang | Eina | Evidència independent revisada per iguals | Domini obert | Fiabilitat test-retest | Validesa predictiva | Gratuïta |
|---|---|---|---|---|---|---|
| 1 | Avaluacions basades en IPIP | Sòlida | Sí | ρtt ≈ 0,82 per a les escales Big Five | Responsabilitat ρ = 0,22 per al rendiment laboral | Sí |
| 2 | Cèrcol | Hereta l'evidència IPIP | Sí (IPIP) | Hereta l'evidència IPIP | Hereta l'evidència IPIP, més valoracions d'iguals | Lluna Nova i Quart Creixent gratuïts, Lluna Plena de pagament (gratuïta durant la beta oberta) |
| 3 | Open Source Psychometrics | Sòlida per a les eines IPIP | Sí | Hereta l'evidència IPIP | Hereta l'evidència IPIP | Sí |
| 4 | 16Personalities | No localitzada | No | No localitzada | No localitzada | Sí |
| 5 | MBTI | Les revisions troben insuficient l'evidència | No | Cap estudi de retest en una síntesi de 193 estudis | L'editor descarta l'ús en selecció | No |
| 6 | DISC | Escassa | No | Informada pels proveïdors | No establerta | Mixta |
| 7 | Eneagrama | Mixta en 104 mostres | Varia | Mixta | No establerta | Parcial |
Com triar la prova de personalitat gratuïta adequada per al teu equip
Per a la majoria d'equips que comencen des de zero, un enfocament en dos passos funciona bé:
- Comença amb una autoavaluació gratuïta basada en IPIP, tant si és amb Open Source Psychometrics com amb el Cèrcol de Quart Creixent, per establir una base del perfil Big Five de cada persona.
- Afegeix l'avaluació d'iguals (Testimonis) per veure on divergeixen l'autopercepció i l'experiència dels altres. Aquesta bretxa sovint és on es produeixen les converses de desenvolupament més útils, i és la part que té suport metaanalític al darrere doi:10.1037/a0021212.
Si el teu equip utilitza DISC o 16Personalities com a llenguatge compartit, no has d'abandonar aquest vocabulari. Però incorporar-hi al costat un instrument Big Five com cal et donarà la resolució dimensional i l'evidència de validesa publicada que aquelles eines no tenen.
Per a una immersió més profunda en el que realment estàs pagant, o no pagant, quan compares opcions de codi obert i comercials, consulta proves de personalitat: codi obert contra comercial.
Prova una avaluació de personalitat per a equips gratuïta i amb fonts
Cèrcol ocupa el lloc que ocupa perquè és una implementació d'IPIP, no pel fet de ser nostre. Els ítems són de domini públic, la puntuació es pot inspeccionar, i les xifres d'aquesta pàgina són les que els articles subjacents diuen realment.
El Cèrcol de Quart Creixent són 60 ítems i es fa en uns deu minuts; retorna cinc puntuacions de dimensió i 30 de faceta. El Cèrcol de Lluna Nova és una orientació de deu ítems i dos minuts. L'avaluació d'iguals Testimoni, que forma part del Cèrcol de Lluna Plena, gratuït per als comptes nous durant la beta oberta, convida fins a dotze persones que et coneixen a completar una tasca d'adjectius de selecció forçada de cinc minuts. La selecció forçada importa per un motiu mesurable: en una metaanàlisi d'avaluació d'alt risc, les mesures de personalitat de selecció forçada van mostrar un efecte global d'inflació de la puntuació de 0,06, molt per sota de la inflació informada per a les mesures Likert d'enunciat únic doi:10.1037/apl0000414. Consulta com tracta Cèrcol el biaix de desitjabilitat social i per què 120 ítems són millor que 10 per al raonament del disseny de la mesura.
Comença l'avaluació del teu equip a cercol.team. Llegeix la fonamentació científica per veure exactament què estàs mesurant i per què.
Fonts
- Barrick, M. R., & Mount, M. K. (1991). The Big Five personality dimensions and job performance: A meta-analysis. Personnel Psychology, 44(1), 1–26. https://doi.org/10.1111/j.1744-6570.1991.tb00688.x
- Gnambs, T. (2014). A meta-analysis of dependability coefficients (test-retest reliabilities) for measures of the Big Five. Journal of Research in Personality, 52, 20–28. https://doi.org/10.1016/j.jrp.2014.06.003
- Johnson, J. A. (2014). Measuring thirty facets of the Five Factor Model with a 120-item public domain inventory: Development of the IPIP-NEO-120. Journal of Research in Personality, 51, 78–89. https://doi.org/10.1016/j.jrp.2014.05.003
- Maples-Keller, J. L., Williamson, R. L., Sleep, C. E., Carter, N. T., Campbell, W. K., & Miller, J. D. (2019). Using item response theory to develop a 60-item representation of the NEO PI-R using the International Personality Item Pool: Development of the IPIP-NEO-60. Journal of Personality Assessment, 101(1), 4–15. https://doi.org/10.1080/00223891.2017.1381968
- Gosling, S. D., Rentfrow, P. J., & Swann, W. B., Jr. (2003). A very brief measure of the Big-Five personality domains. Journal of Research in Personality, 37(6), 504–528. https://doi.org/10.1016/S0092-6566(03)00046-1
- McCrae, R. R., & Costa, P. T. (1997). Personality trait structure as a human universal. American Psychologist, 52(5), 509–516. https://doi.org/10.1037/0003-066X.52.5.509
- McCrae, R. R., & Costa, P. T. (1989). Reinterpreting the Myers-Briggs Type Indicator from the perspective of the five-factor model of personality. Journal of Personality, 57(1), 17–40. https://doi.org/10.1111/j.1467-6494.1989.tb00759.x
- Connelly, B. S., & Ones, D. S. (2010). An other perspective on personality: Meta-analytic integration of observers' accuracy and predictive validity. Psychological Bulletin, 136(6), 1092–1122. https://doi.org/10.1037/a0021212
- Cao, M., & Drasgow, F. (2019). Does forcing reduce faking? A meta-analytic review of forced-choice personality measures in high-stakes situations. Journal of Applied Psychology, 104(11), 1347–1368. https://doi.org/10.1037/apl0000414
- Erford, B. T., Zhang, X., Sweeting, E., Russo, M., Rashid, A., Sherman, M. F., et al. (2025). A 25-year review and psychometric synthesis of the Myers-Briggs Type Indicator (MBTI), Form M. Journal of Counseling and Development, 103(4), 403–417. https://doi.org/10.1002/jcad.70006
- Pittenger, D. J. (1993). The utility of the Myers-Briggs Type Indicator. Review of Educational Research, 63(4), 467–488. https://doi.org/10.3102/00346543063004467
- Pittenger, D. J. (2005). Cautionary comments regarding the Myers-Briggs Type Indicator. Consulting Psychology Journal: Practice and Research, 57(3), 210–221. https://doi.org/10.1037/1065-9293.57.3.210
- Hook, J. N., Hall, T. W., Davis, D. E., Van Tongeren, D. R., & Conner, M. (2021). The Enneagram: A systematic review of the literature and directions for future research. Journal of Clinical Psychology, 77(4), 865–883. https://doi.org/10.1002/jclp.23097
- Jones, C. S., & Hartley, N. T. (2013). Comparing correlations between four-quadrant and five-factor personality assessments. American Journal of Business Education, 6(4), 459–470. https://doi.org/10.19030/ajbe.v6i4.7945
- Marston, W. M. (1928). Emotions of Normal People. Kegan Paul, Trench, Trubner and Co.
- IPIP: International Personality Item Pool, declaració de domini públic i biblioteca d'ítems.
- Open Source Psychometrics Project, arxiu de dades en brut: https://openpsychometrics.org/_rawdata/
- 16Personalities, pàgina de teoria del NERIS Type Explorer: https://www.16personalities.com/articles/our-theory
- The Myers-Briggs Company, orientació contra l'ús en reclutament i selecció: https://www.themyersbriggs.com
- Psychometrics Canada, nombre d'ítems i preu del MBTI Step I Form M: https://shop.psychometrics.com
- Truity, prova de personalitat DISC gratuïta: https://www.truity.com/test/disc-personality-test
- Wikipedia: DISC assessment
- Wikipedia: Myers-Briggs Type Indicator
Lectures addicionals
- MBTI vs Big Five: quin hauria d'utilitzar el teu equip?
- DISC vs Big Five: per què quatre estils no són suficients
- 16Personalities vs Big Five: la prova viral que encerta a mitges
- Què signifiquen la fiabilitat i la validesa en els tests de personalitat
- Biaix de desitjabilitat social en els tests de personalitat
- Com es calculen les puntuacions dels tests de personalitat: dels ítems a les dimensions