Lanzamiento beta: quedan 488 licencias gratuitas de Full Moon. Ayúdanos a detectar errores.
Reclama tu acceso gratuito

Anonimato en la evaluación de personalidad: por qué importa

La evaluación con consecuencias infla la Responsabilidad media desviación típica. Por qué el contexto distorsiona las puntuaciones en Cèrcol.

Miquel Matoses·14 min de lectura

Cuando rellenas un cuestionario de personalidad no estás operando en el vacío. Sabes, de forma consciente o no, quién va a ver los resultados. Y ese conocimiento cambia lo que dices.

Es uno de los hallazgos más sólidos y peor valorados de toda la literatura sobre medición de la personalidad. El contexto social de una evaluación, quién la ha encargado, quién tendrá acceso a los resultados, qué consecuencias pueden derivarse, moldea sistemáticamente las respuestas, y a menudo de maneras invisibles tanto para quien responde como para quien interpreta las puntuaciones. Hay una introducción general al concepto y sus implicaciones en Wikipedia: Anonymity.

Quien administra evaluaciones suele reconocer este problema en abstracto y subestimarlo en la práctica. Conocer la investigación sobre anonimato y sesgo de deseabilidad social es imprescindible para cualquiera que quiera usar datos de personalidad de forma responsable, ya sea para el desarrollo personal, para entender a un equipo o con fines organizativos.


Mírate en cinco dimensiones.

Empieza el test gratis

Sesgo de deseabilidad social: por qué el contexto de la evaluación distorsiona las puntuaciones

El sesgo de deseabilidad social es la tendencia a responder de la manera que uno cree que los demás verán con buenos ojos. En la evaluación de la personalidad se manifiesta como una inflación sistemática de las puntuaciones en los rasgos percibidos como positivos, Conscientiousness, Agreeableness, Extraversion, y una deflación sistemática en los percibidos como negativos, Neuroticism y, a veces, ciertas facetas de la Openness. Para un tratamiento exhaustivo de cómo opera este sesgo, véase el sesgo de deseabilidad social en los tests de personalidad.

El efecto no es uniforme de una persona a otra. La literatura distingue dos componentes de la respuesta socialmente deseable: el autoengaño, la creencia genuina pero inflada en las propias cualidades positivas, y la gestión de la impresión, la presentación deliberada de una imagen favorable de uno mismo. El autoengaño es relativamente estable entre contextos; la gestión de la impresión es muy sensible al contexto de evaluación.

Lo que dispara la gestión de la impresión es la percepción de lo que hay en juego. Cuando no hay gran cosa en juego, cuando crees que los resultados son solo para tu propia reflexión, la gestión de la impresión es mínima. Cuando hay mucho en juego, cuando crees que los resultados pueden afectar a decisiones de contratación, evaluaciones de desempeño o al acceso a determinadas oportunidades, la gestión de la impresión aumenta. El contenido del cuestionario no ha cambiado; lo que ha cambiado es el contexto social.

¿De qué tamaño es el desplazamiento? La mejor estimación disponible procede de un metaanálisis de 33 estudios que comparó las puntuaciones de candidatos reales a un puesto con las de no candidatos en las mismas medidas. Los candidatos puntuaron más alto en Responsabilidad (d = 0,45), estabilidad emocional (d = 0,44), Apertura (d = 0,13) y Extraversión (d = 0,11) doi:10.1111/j.1468-2389.2006.00354.x. La Amabilidad no figuraba entre las dimensiones con una ventaja significativa para los candidatos. A grandes rasgos, pues, las dos dimensiones que más interesan a los empleadores se mueven algo menos de media desviación típica cuando el contexto pasa de la investigación a la selección, y las otras tres apenas se mueven.


Condiciones anónimas frente a identificadas: qué muestra la investigación

Una literatura experimental consistente ha examinado cómo cambian las puntuaciones de personalidad cuando las mismas personas rellenan el mismo cuestionario bajo distintas condiciones de divulgación.

Las condiciones anónimas, en las que se dice a los participantes que sus respuestas individuales no pueden vincularse a su identidad, se asocian a menos distorsión. Un metaanálisis de 61 estudios y 673 tamaños de efecto que cubría cuestionarios informatizados, cuestionarios en papel y entrevistas cara a cara encontró que la distorsión por deseabilidad social era pequeña precisamente cuando quien respondía estaba solo, era anónimo y podía volver atrás sobre sus respuestas doi:10.1037/0021-9010.84.5.754. En ese análisis, el anonimato es una condición entre varias que determinan conjuntamente hasta qué punto una evaluación se percibe como privada; no es un interruptor que apague el sesgo por sí solo, y ningún estudio pone un porcentaje único a cuánto lo elimina.

Las condiciones identificadas con un marco en el que hay mucho en juego, cuando los participantes saben que los resultados los verá un empleador o un comité de selección, producen la mayor inflación. El metaanálisis de candidatos citado arriba es la medición directa de esto: Responsabilidad en d = 0,45 y estabilidad emocional en d = 0,44 respecto a muestras de no candidatos doi:10.1111/j.1468-2389.2006.00354.x. Como la estabilidad emocional es el polo inverso del Neuroticismo, ese mismo resultado es una supresión del Neuroticismo de idéntica magnitud, y por eso la cifra de abajo se expresa en los términos que empleó el metaanálisis.

Las condiciones de desarrollo, en las que se dice a los participantes que los resultados son para su propio aprendizaje y no se compartirán sin su consentimiento, quedan entre las anónimas y las de selección. Decirle a alguien "esto es para tu desarrollo" reduce la gestión de la impresión, pero no la elimina, porque quien responde sigue interactuando con una persona o una plataforma a las que atribuye capacidad de juicio. La magnitud de ese caso intermedio no se ha metaanalizado, así que aquí se describe de forma cualitativa y sin coeficiente.

La implicación práctica es directa: si quieres saber cómo es realmente alguien, el contexto en el que lo evalúas importa tanto como el instrumento que uses. Esa misma lógica explica por qué la evaluación entre iguales es más fiable que el autoinforme por sí solo: los compañeros observan comportamiento real, no impresiones gestionadas.

d = 0,44
supresión del Neuroticismo, candidatos a un puesto frente a no candidatos

Cómo los contextos con mucho en juego inflan las puntuaciones de personalidad en la contratación

El problema se agudiza en la selección de personal, donde la evaluación de la personalidad se ha generalizado. Cuando los candidatos saben, o sospechan, que sus puntuaciones influirán en la decisión de contratación, tienen un fuerte incentivo para presentarse como muy responsables, fiablemente amables y emocionalmente estables. La investigación muestra que hacen lo primero y lo tercero. Para el tratamiento completo de la distorsión deliberada, véase ¿se puede falsear un test de personalidad?.

Esto genera un problema sistemático en los usos de selección. Las puntuaciones que las organizaciones recogen en contextos de selección con mucho en juego no son las mismas que recogerían de esas mismas personas en un contexto de desarrollo sin nada en juego. Representan una mezcla de expresión genuina del rasgo y autopresentación deliberada. Cómo separar ambas cosas no es evidente, y las técnicas psicométricas existentes para detectar y corregir el falseo, formatos de elección forzada, comprobaciones de consistencia, escalas de deseabilidad social, tienen todas limitaciones importantes.

Algunos proveedores de evaluación han respondido a esto argumentando que el falseo de los candidatos da igual, porque las puntuaciones siguen prediciendo el desempeño aunque estén infladas. El argumento tiene respaldo empírico real. Un metaanálisis de la literatura sobre deseabilidad social encontró que las escalas de deseabilidad social no predecían el desempeño laboral, el éxito escolar, el desempeño en la tarea ni los comportamientos contraproducentes, y que la deseabilidad social no funciona como supresora ni como mediadora útil del desempeño laboral; retirar sus efectos de las dimensiones del Big Five deja intacta su validez en el trabajo doi:10.1037/0021-9010.81.6.660. Un estudio posterior fue más allá y puso en duda cuánto falseo se produce en realidad: entre 5.266 candidatos rechazados que volvieron a presentarse al mismo puesto seis meses después y repitieron la misma medida de cinco factores, un 5,2 % o menos mejoró su puntuación en alguna escala, y los cambios bajaban tanto como subían doi:10.1037/0021-9010.92.5.1270.

Esa evidencia esquiva el problema de fondo más que resolverlo. Si lo que intentas es entender la personalidad real de alguien con fines de desarrollo o de construcción de equipo, las puntuaciones infladas te despistan activamente, correlacionen o no con un criterio de desempeño. El argumento de que el falseo no importa para la predicción se sostiene sobre todo en contextos de selección con criterios de desempeño claros; se sostiene mucho peor cuando el objetivo es entender de verdad la personalidad.

Para un análisis más amplio de las dimensiones legales y éticas de la evaluación de la personalidad en el empleo, véase tests de personalidad en la contratación: qué es legal y qué es ético.


Por qué la transparencia en la evaluación produce datos de personalidad más honestos

Si los contextos con mucho en juego inflan las puntuaciones, una respuesta es rebajar lo que hay en juego. Eso pasa por replantear de quién son los datos y para qué se pueden usar.

El argumento a favor de la transparencia descansa en el consentimiento informado y en la propiedad individual. Cuando rellenas una evaluación de personalidad y mantienes el control total sobre quién ve los resultados, y puedes confiar en que no son accesibles para tu empresa, tu jefe ni nadie que pudiera usarlos en tu contra, tienes un buen motivo para responder con honestidad. El cálculo de deseabilidad social cambia: no hay público al que impresionar.

Conviene precisar qué tipo de transparencia es la que funciona. Limitarse a advertir a quien responde de que el falseo es detectable tiene un efecto medible pero pequeño: una revisión de la literatura sobre advertencias lo situó en d = 0,23, con puntuaciones más bajas entre los advertidos que entre los no advertidos y con una magnitud que depende del tipo de advertencia empleado doi:10.1207/S15327043HUP1601_1. La transparencia estructural, diseñar sistemas de evaluación en los que las personas posean y controlen de verdad sus datos, apunta al incentivo en lugar de a la advertencia. Cuando sabes que nadie más que tú verá los resultados salvo que decidas compartirlos, la estrategia óptima de gestión de la impresión es sencillamente ser preciso.

No es una visión ingenua. La gente conserva motivos de autopresentación que operan incluso en contextos genuinamente privados: el autoengaño no desaparece. Pero eliminar el público externo elimina el principal motor del falseo deliberado. El diseño de los ítems también cuenta: los formatos de elección forzada quitan la posibilidad de suscribir sin más todos los descriptores positivos y trabajan junto al anonimato para mejorar la calidad de los datos.


El diseño de Cèrcol: la propiedad individual de los datos como estrategia de precisión

Cèrcol está diseñado en torno al principio de que los resultados de personalidad pertenecen a la persona evaluada, no a una organización, una empresa o una plataforma. No es una característica secundaria: es una decisión arquitectónica de base que se desprende directamente de la investigación sobre anonimato y deseabilidad social.

Cuando alguien sabe que su perfil de Cèrcol es suyo, que no será visible para su empresa salvo que decida activamente compartirlo, y que las evaluaciones de los Testigos pasan por un marco de consentimiento que controla esa persona, el contexto de evaluación deja de tener mucho en juego y pasa a ser genuinamente de desarrollo. La investigación predice que las puntuaciones obtenidas en ese contexto serán más honestas, más precisas y más útiles que las obtenidas en un contexto convencional de selección o evaluación.

El modelo de evaluación entre iguales, en el que los Testigos que conocen a la persona rellenan su propia valoración de su personalidad, añade una capa más de precisión al introducir perspectivas independientes, menos sensibles a los sesgos de autopresentación de la propia persona. El autoengaño se sostiene mal frente a un conjunto convergente de valoraciones hechas por gente que te ve en contexto. Esto se explica al detalle en qué mide el instrumento Testigo de Cèrcol.


Condición de evaluación frente a calidad de la puntuación: una comparación

Condición de evaluaciónInflación típica de la puntuaciónImplicación para la confianza
Investigación anónima (identificación imposible)Mínima, línea base de la medición del rasgoLa mayor validez con fines de investigación
Desarrollo (solo la persona ve sus resultados)Baja, queda un motivo modesto de autopresentación; no metaanalizadaBuena para entenderse de verdad a uno mismo
Encargada por la empresa, con marco de desarrolloModerada, depende de la confianza en la organización; no metaanalizadaLas puntuaciones mezclan rasgo y contexto
Selección con mucho en juego (la empresa ve los resultados)En torno a d = 0,45 en Responsabilidad y estabilidad emocionalLas puntuaciones exigen mucha cautela interpretativa
Evaluación organizativa forzada u obligatoriaNo medida por separado; aquí el incentivo para gestionar la impresión es máximoLas puntuaciones deben tratarse con escepticismo

La única fila con un número es la que la literatura ha medido doi:10.1111/j.1468-2389.2006.00354.x. Las demás están ordenadas por la fuerza del incentivo a gestionar la impresión, no por tamaños de efecto medidos, y así hay que leerlas.


Buenas prácticas: cuatro principios para una evaluación de personalidad responsable

La evidencia sobre anonimato y deseabilidad social apunta a varios principios claros para una evaluación de personalidad responsable.

Propiedad individual de los datos. Los resultados deben pertenecer por defecto a la persona evaluada. Compartirlos debe exigir un consentimiento explícito y revocable. La persona evaluada debe poder ver siempre sus propios resultados antes que nadie.

Propósito transparente. El propósito declarado de la evaluación debe ser el real. "Esto es para tu desarrollo" no puede ser la envoltura tranquilizadora de unos datos que acabarán en una evaluación de desempeño o en una decisión de promoción. Engañar sobre el propósito es éticamente incorrecto y prácticamente contraproducente: destruye la confianza que hace posible responder con honestidad.

Un marco sin nada en juego. Siempre que se pueda, la evaluación de personalidad debe plantearse como herramienta de conocimiento personal, no como juicio organizativo. Las organizaciones que quieran datos de personalidad genuinos, y no perfiles de gestión de la impresión, deben invertir en construir las condiciones de confianza que hacen racional responder con honestidad.

Conciencia de los efectos de contexto. Quien interprete puntuaciones de personalidad debe saber en qué condiciones se obtuvieron. Una puntuación de Responsabilidad obtenida en un proceso de selección y una obtenida en un contexto anónimo de desarrollo no son medidas equivalentes, y la literatura sobre candidatos sitúa la brecha cerca de media desviación típica. Tratarlas como intercambiables es un error de interpretación. Para el trasfondo de qué hace válida una medida, véase ¿qué son la fiabilidad y la validez en los tests de personalidad?.

Por qué Cèrcol usa valoraciones anónimas entre iguales

La investigación revisada aquí lleva a una conclusión de diseño clara: los contextos anónimos y sin nada en juego producen los datos de personalidad más honestos. Cèrcol está construido sobre ese principio desde la base. Las valoraciones de los Testigos se recogen de forma anónima, quienes valoran saben que sus respuestas individuales no son atribuibles, y la persona evaluada es dueña de su propio perfil y lo comparte solo cuando quiere. Eso elimina el incentivo principal para gestionar la impresión por ambos lados. Combinado con un formato de ítems de elección forzada que hace estructuralmente difícil falsear, el diseño de Cèrcol ataca de forma sistemática los sesgos que socavan las evaluaciones convencionales. Puedes comprobarlo tú mismo: la evaluación completa es gratuita en cercol.team. Para saber más sobre cómo funciona el instrumento Testigo, entra en /instruments.


Lecturas relacionadas: El sesgo de deseabilidad social en los tests de personalidad · Tests de personalidad en la contratación: qué es legal y qué es ético

Fuentes

Lecturas relacionadas

Cèrcol

Mírate en cinco dimensiones.

Sesenta ítems, unos diez minutos. Cinco dimensiones y 30 facetas. Gratis, sin cuenta.

Empieza el test de 60 ítemsVer un informe de ejemplo

Artículos relacionados

Cèrcol usa solo cookies funcionales, sin analíticas, sin rastreadores publicitarios. Política de privacidad