Ideología y moralidad implícita en los grandes modelos de lenguaje (LLM): estudios experimentales

Resumen
Los asistentes conversacionales basados en grandes modelos de lenguaje (ChatGPT, Claude, Gemini, Llama, entre otros) se han convertido en interlocutores cotidianos a los que se consultan dudas prácticas, pero también dilemas personales, cuestiones políticas y problemas morales. Este ensayo examina si existen estudios experimentales que hayan interrogado a estos modelos con preguntas cuya respuesta presupone un posicionamiento moral o ideológico, y qué han encontrado. La respuesta es afirmativa: desde 2022 se ha desarrollado una literatura abundante que aplica a los modelos cuestionarios de orientación política, encuestas de opinión pública, cuestionarios de psicología moral y dilemas clásicos como el del tranvía. Sus resultados convergen en algunos puntos (una inclinación frecuente hacia posiciones progresistas y liberales en sentido anglosajón, una cercanía a los valores de las sociedades occidentales, educadas e industrializadas, y una notable sensibilidad a la forma en que se formula la pregunta) y discrepan en otros. El ensayo analiza después lo que estos hallazgos significan desde la filosofía moral y política (la imposibilidad de una neutralidad perfecta, el pluralismo de valores, la autonomía moral del usuario, la legitimidad de quien fija los valores de la máquina) y desde el derecho, con especial atención al marco español y europeo.
1. Introducción: una pregunta que ya no es hipotética
Hasta hace pocos años, preguntarse por la «moral» o la «ideología» de una máquina era un ejercicio de ciencia ficción o, como mucho, de filosofía especulativa. Hoy es una cuestión empírica y práctica. Cientos de millones de personas consultan a diario a asistentes conversacionales que no se limitan a recuperar información: redactan, aconsejan, resumen debates y, cuando se les pregunta, opinan o al menos parecen opinar. Si un estudiante pide a uno de estos sistemas que le explique los argumentos sobre la eutanasia, si una persona le pregunta si debería denunciar a un compañero de trabajo o si un votante indeciso le solicita una comparación entre programas electorales, la respuesta que recibe no es moralmente inocua. Seleccionar qué argumentos se presentan primero, cuáles se califican de «sólidos» y cuáles de «controvertidos», qué se considera un hecho y qué una opinión, son decisiones con contenido normativo.
La pregunta que guía este ensayo es doble. En primer lugar, una pregunta de hecho: ¿existen estudios experimentales que hayan sometido a los modelos de lenguaje a preguntas que exigen tomar una posición moral o que pueden revelar una ideología? En segundo lugar, una pregunta de sentido: ¿qué significan esos resultados desde el punto de vista ético, filosófico y jurídico? La primera tiene una respuesta clara: sí, existen, y son ya numerosos. La segunda es más difícil y exige separar con cuidado lo que los datos muestran de lo que con frecuencia se les atribuye.
El ensayo se organiza del siguiente modo. Tras unas precisiones conceptuales sobre qué puede significar que una máquina «tenga» moral o ideología (apartado 2) y una explicación no técnica del origen de esos valores (apartado 3), se revisan los estudios sobre orientación política (apartado 4), sobre juicio moral (apartado 5) y sobre la influencia de los modelos en las personas (apartado 6). El apartado 7 discute los límites metodológicos de esta literatura. Los apartados 8 y 9 abordan, respectivamente, la reflexión filosófica y la dimensión jurídica. El ensayo concluye con una valoración de conjunto y algunas preguntas abiertas.
2. ¿Puede una máquina tener moral o ideología? Precisiones conceptuales
Antes de examinar los estudios conviene aclarar el vocabulario, porque buena parte de la confusión pública sobre este tema procede de usar en sentido literal términos que solo pueden aplicarse a las máquinas en sentido analógico.
Un modelo de lenguaje es, en esencia, un sistema que ha aprendido, a partir de enormes cantidades de texto escrito por personas, a producir continuaciones plausibles de un texto dado, y que después ha sido ajustado para comportarse como un asistente útil y cortés. No tiene, hasta donde sabemos, convicciones en el sentido en que las tiene una persona: no ha llegado a ellas por experiencia vital, no está dispuesto a sacrificar nada por ellas y no sufre remordimiento cuando las traiciona. Bender, Gebru, McMillan-Major y Shmitchell (2021) popularizaron la imagen del «loro estocástico» para subrayar que estos sistemas recombinan patrones lingüísticos sin acceso al significado en el sentido humano del término.
Sin embargo, de ello no se sigue que hablar de la «moralidad implícita» o la «ideología» de un modelo carezca de sentido. Puede entenderse en un sentido disposicional y conductual: un modelo tiene una orientación moral o ideológica en la medida en que, ante preguntas con contenido normativo, sus respuestas muestran regularidades sistemáticas que, si procedieran de una persona, atribuiríamos a un conjunto determinado de valores. Es lo que podríamos llamar la «actitud intencional» del observador: tratamos al sistema como si tuviera creencias porque esa descripción predice bien su comportamiento, sin comprometernos con lo que ocurre en su interior.
Esta precisión permite distinguir tres niveles que a menudo se confunden:
• Moralidad explícita: los principios que los desarrolladores declaran haber incorporado deliberadamente, como evitar daños, no discriminar o ser honesto. Algunas empresas publican estos principios en forma de «constitución» (Bai et al., 2022).
• Moralidad implícita: las regularidades valorativas que emergen de las respuestas del modelo sin que nadie las haya programado expresamente, heredadas de los textos con los que se entrenó o de las preferencias de las personas que evaluaron sus respuestas.
• Ideología: un subconjunto de la moralidad implícita referido a cuestiones de organización política y social (el papel del Estado, la redistribución, la inmigración, el medio ambiente, los derechos de las minorías, la religión en la esfera pública) en el que existe desacuerdo razonable entre ciudadanos y que suele cristalizar en programas partidistas.
La distinción importa porque la evaluación ética no es la misma en cada caso. Que un modelo se niegue a explicar cómo fabricar un arma química expresa un valor, pero difícilmente una ideología en sentido partidista: existe un consenso casi universal al respecto. Que un modelo se muestre sistemáticamente más favorable a un impuesto sobre el carbono que a la reducción de impuestos sobre la renta es, en cambio, una toma de partido en un terreno de desacuerdo razonable. Gran parte del debate filosófico que se expondrá más adelante gira precisamente en torno a dónde trazar la línea entre ambos tipos de cuestiones.
3. ¿De dónde vendrían esos valores?
Sin entrar en detalles técnicos, la literatura identifica tres fuentes principales de las orientaciones valorativas de un modelo de lenguaje.
La primera son los datos de entrenamiento. Los modelos aprenden de grandes colecciones de textos procedentes de internet, libros, prensa, foros y enciclopedias. Esos textos no son una muestra representativa de la humanidad: sobrerrepresentan el inglés, a los países ricos, a las personas jóvenes y con estudios y a determinadas comunidades en línea. Bender et al. (2021) advirtieron de que esta composición tiende a amplificar las perspectivas hegemónicas. Feng, Park, Liu y Tsvetkov (2023) mostraron experimentalmente que los modelos absorben las inclinaciones políticas de sus datos: al continuar el entrenamiento con textos de medios de una orientación determinada, el modelo se desplazaba en esa dirección, y esa inclinación afectaba después a tareas aparentemente neutrales, como detectar discurso de odio o desinformación.
La segunda fuente es el ajuste con preferencias humanas. Tras el entrenamiento inicial, los modelos se refinan para que sus respuestas sean útiles, inofensivas y honestas. Para ello, grupos de evaluadores comparan respuestas alternativas e indican cuál prefieren, y el modelo aprende a producir respuestas del tipo preferido (Ouyang et al., 2022). Este paso, decisivo para convertir un generador de texto en un asistente, introduce los juicios de un grupo relativamente pequeño de personas, con su perfil cultural y sus intuiciones morales. Santurkar et al. (2023) encontraron que precisamente este ajuste desplazaba las opiniones de los modelos hacia las de los grupos más liberales, con mayores ingresos y mayor nivel educativo de la sociedad estadounidense.
La tercera fuente son las instrucciones y principios explícitos que fijan las empresas: políticas de uso, listas de temas sensibles, directrices de equilibrio o constituciones escritas. El enfoque de la «IA constitucional» (Bai et al., 2022) consiste en que el modelo evalúe y corrija sus propias respuestas a la luz de una lista de principios redactada por los desarrolladores. Tiene la ventaja de hacer explícitos y auditables los valores, pero desplaza la pregunta: ¿quién redacta la constitución y con qué legitimidad?
Buyl et al. (2026) añaden una cuarta dimensión, de naturaleza geopolítica: al comparar modelos desarrollados en distintos países y al interrogarlos en distintos idiomas, encontraron que las valoraciones de figuras políticas y acontecimientos históricos reflejaban, en parte, la cosmovisión del entorno de sus creadores. Los modelos occidentales y los chinos, por ejemplo, diferían de manera sistemática, e incluso un mismo modelo variaba según se le preguntara en inglés o en chino. La conclusión de los autores es significativa: la neutralidad ideológica de un modelo no debe presumirse, y la diversidad de proveedores puede ser en sí misma una garantía de pluralismo.
4. Los estudios experimentales sobre ideología política
La primera oleada de estudios, iniciada pocas semanas después del lanzamiento público de ChatGPT a finales de 2022, siguió una estrategia sencilla: aplicar al modelo los mismos cuestionarios que se aplican a las personas para situarlas en el espectro político y observar dónde «caía».
Hartmann, Schwenzow y Witte (2023) sometieron a ChatGPT a cientos de afirmaciones procedentes de herramientas de orientación de voto utilizadas en Alemania y los Países Bajos, así como al conocido Political Compass. El resultado, robusto a distintas formulaciones e idiomas, fue una orientación que los autores calificaron de proambientalista e izquierdista-libertaria: en las elecciones simuladas, el modelo habría votado preferentemente por partidos verdes y de izquierda. Rozado (2023) aplicó quince pruebas de orientación política distintas y encontró que en catorce de ellas las respuestas del modelo se situaban a la izquierda del centro.
Un año después, el mismo autor amplió el análisis a veinticuatro modelos de diferentes empresas con once pruebas distintas (Rozado, 2024). La mayoría de los modelos conversacionales, es decir, los ya ajustados para dialogar con usuarios, tendían a respuestas que las pruebas clasificaban de centroizquierda. Dos hallazgos complementarios resultan especialmente relevantes para la reflexión ética. Por un lado, los modelos «base», antes del ajuste conversacional, no mostraban esa inclinación de manera consistente, lo que apunta al ajuste con preferencias humanas como fuente principal del sesgo. Por otro, con una pequeña cantidad de datos adicionales era posible desplazar un modelo hacia la izquierda, hacia la derecha o hacia el centro, lo que demuestra la facilidad con que la orientación de un sistema puede ser manipulada deliberadamente.
Motoki, Pinho Neto y Rodrigues (2024) diseñaron un procedimiento más sutil. Pidieron a ChatGPT que respondiera a un cuestionario primero «por defecto» y luego haciéndose pasar por un votante demócrata o republicano en Estados Unidos (y por simpatizantes de partidos en Brasil y el Reino Unido). Las respuestas por defecto resultaron mucho más próximas a las del perfil demócrata, del Partido de los Trabajadores de Lula y del laborismo británico que a las de sus rivales. Fujimoto y Takemoto (2023), al repetir las pruebas con versiones posteriores, observaron que las inclinaciones parecían haberse atenuado, lo que ilustra un problema metodológico que se discutirá después: los modelos cambian constantemente y los resultados caducan con rapidez.
Otro grupo de estudios ha abandonado los tests ideológicos para comparar al modelo con poblaciones reales. Santurkar et al. (2023) utilizaron preguntas de las encuestas del Pew Research Center para medir con qué grupos demográficos de la sociedad estadounidense coincidían las opiniones de los modelos. Los modelos ajustados tendían a parecerse a los ciudadanos liberales, con estudios universitarios y mayores ingresos, mientras que grupos como las personas mayores de 65 años, las viudas o las personas muy religiosas quedaban mal representados. Durmus et al. (2023) extendieron el método a escala internacional con encuestas como la World Values Survey: las respuestas de los modelos se parecían más a las de Estados Unidos y algunos países europeos que a las de otras regiones del mundo. Cuando se pedía al modelo que respondiera como un ciudadano de un país concreto, sus respuestas cambiaban, pero a veces recurriendo a estereotipos culturales.
Por último, Röttger et al. (2024) pusieron en cuestión buena parte de esta primera oleada. Mostraron que, cuando se obliga a un modelo a elegir entre opciones cerradas («muy de acuerdo», «en desacuerdo»...), sus respuestas pueden variar sustancialmente con pequeños cambios en la formulación, y que cuando se le permite responder libremente, su posición expresada no coincide necesariamente con la obtenida en el formato forzado. De ahí el título de su trabajo: el resultado se parece más a una «flecha que gira» que a una brújula estable. Esta crítica no invalida los estudios anteriores, pero exige interpretarlos con prudencia.
La Tabla 1 resume los principales estudios sobre orientación política.
Tabla 1
Principales estudios experimentales sobre orientación política de los modelos de lenguaje
Estudio | Qué se preguntó al modelo | Resultado principal |
Hartmann et al. (2023) | Afirmaciones de herramientas de orientación de voto (Alemania, Países Bajos) y Political Compass | Orientación proambientalista e izquierdista-libertaria en ChatGPT |
Rozado (2023) | 15 tests de orientación política | 14 de 15 tests sitúan a ChatGPT a la izquierda del centro |
Rozado (2024) | 11 tests aplicados a 24 modelos | Los modelos conversacionales tienden al centroizquierda; los modelos base, no; la orientación puede desplazarse con poco ajuste |
Motoki et al. (2024) | Cuestionario respondido por defecto y suplantando a votantes de distintos partidos (EE. UU., Brasil, Reino Unido) | Las respuestas por defecto se aproximan a demócratas, Lula y laboristas |
Fujimoto y Takemoto (2023) | Repetición de tests con versiones posteriores de ChatGPT | Inclinación atenuada en versiones más recientes |
Feng et al. (2023) | Tests políticos y entrenamiento adicional con medios de distinta orientación | Los datos de entrenamiento transmiten inclinaciones que afectan a tareas posteriores |
Santurkar et al. (2023) | Preguntas de encuestas Pew | Más cercanía a grupos liberales, educados y de mayores ingresos de EE. UU. |
Durmus et al. (2023) | Encuestas internacionales (World Values Survey y otras) | Más cercanía a EE. UU. y Europa occidental que a otras regiones |
Röttger et al. (2024) | Formato cerrado frente a respuesta abierta, con paráfrasis | Las posiciones son inestables y dependen del formato de pregunta |
Buyl et al. (2026) | Valoración de figuras políticas en varios idiomas y modelos de distinto origen | Los modelos reflejan la cosmovisión de su entorno de creación |
5. Los estudios experimentales sobre juicio moral
En paralelo a los estudios políticos se ha desarrollado una línea de investigación centrada en la moral en sentido más amplio, que recurre a dilemas, escenarios cotidianos y cuestionarios de psicología moral.
Incluso antes de los asistentes conversacionales, Schramowski, Turan, Andersen, Rothkopf y Kersting (2022) mostraron que los modelos de lenguaje contienen una especie de «dirección moral»: una dimensión interna que separa las acciones que las personas consideran correctas de las incorrectas («matar personas» frente a «matar el tiempo»), y que coincide en buena medida con los juicios humanos. Hendrycks et al. (2021) construyeron un banco de pruebas, llamado ETHICS, que evalúa la capacidad de los modelos para aplicar nociones de justicia, deontología, virtud, utilidad y moral de sentido común, y que se convirtió en una referencia para la investigación posterior.
El proyecto Delphi llevó la idea más lejos al entrenar un modelo específicamente para emitir juicios morales sobre situaciones cotidianas a partir de millones de valoraciones humanas (Jiang et al., 2025). Sus autores documentaron tanto sus aciertos como sus limitaciones: el sistema reproducía con bastante fidelidad el sentido común moral estadounidense, pero también algunos de sus sesgos sociales, y podía ser inducido a error con formulaciones engañosas. El experimento fue objeto de un intenso debate público precisamente por su ambición de construir un «oráculo moral».
Dillion, Tandon, Gu y Gray (2023) compararon los juicios morales de GPT-3.5 con los de personas sobre 464 escenarios y encontraron una correlación de 0,95, extraordinariamente alta. Este resultado llevó a los autores a plantear si los modelos podrían sustituir a participantes humanos en ciertos experimentos, aunque advirtieron de que el modelo reproduce el juicio medio de una población concreta y no la diversidad de juicios existentes.
Scherrer, Shi, Feder y Blei (2023) diseñaron un procedimiento especialmente cuidadoso.
Presentaron a veintiocho modelos cientos de escenarios morales de dos tipos: de baja ambigüedad (en los que una de las opciones es claramente preferible según el sentido común) y de alta ambigüedad (dilemas genuinos en los que personas razonables discrepan). En los primeros, casi todos los modelos elegían la opción que la mayoría consideraría correcta. En los segundos, la mayoría expresaba incertidumbre, pero algunos modelos mostraban preferencias claras y consistentes, y los modelos de distintas empresas tendían a coincidir entre sí, lo que sugiere que comparten rasgos del proceso de ajuste. Los autores también observaron que las preferencias cambiaban según cómo se formulara la pregunta.
Un enfoque especialmente fértil ha sido aplicar a los modelos la teoría de los fundamentos morales de Jonathan Haidt y sus colaboradores. Según esta teoría, la moral humana se apoya en varias intuiciones básicas (cuidado frente a daño, equidad, lealtad al grupo, respeto a la autoridad y pureza o santidad), y las personas progresistas tienden a dar más peso a las dos primeras mientras que las conservadoras distribuyen su atención de forma más equilibrada entre todas (Graham, Haidt y Nosek, 2009; Haidt, 2001). Abdulhai et al. (2024) aplicaron el cuestionario de fundamentos morales a varios modelos y encontraron perfiles que se asemejaban a los de determinados grupos políticos humanos, generalmente con más peso en cuidado y equidad; además, comprobaron que el perfil podía ser desplazado mediante instrucciones y que ese desplazamiento afectaba a decisiones posteriores del modelo, como cuánto «donar» en una tarea simulada. Simmons (2023) describió un fenómeno que denominó «mimetismo moral»: cuando se indica al modelo que adopte la identidad de un liberal o de un conservador, genera justificaciones morales que recurren precisamente a los fundamentos que la teoría atribuye a cada grupo. El modelo, en otras palabras, sabe hablar el lenguaje moral de cada tribu política.
Los dilemas del tranvía y sus variantes también se han trasladado a los modelos. El experimento Moral Machine recogió en su día millones de decisiones humanas de más de doscientos países sobre a quién debería sacrificar un vehículo autónomo en caso de accidente inevitable (Awad et al., 2018). Takemoto (2024) presentó los mismos dilemas a varios modelos de lenguaje y encontró que, en términos generales, compartían las prioridades humanas (salvar a más personas, preferir humanos a animales), aunque algunos modelos mostraban preferencias más extremas que las de la población humana en determinadas dimensiones.
Cheung, Maier y Lieder (2025) estudiaron los sesgos cognitivos en las decisiones morales. Encontraron que los modelos mostraban un sesgo de omisión más pronunciado que el humano, es decir, una tendencia a preferir no actuar aunque la acción produjera mejores consecuencias, y además un sesgo hacia responder «no», de modo que la conclusión moral podía invertirse con solo reformular la pregunta. Este resultado tiene una lectura filosófica inquietante, que se retomará más adelante: el ajuste para hacer a los modelos prudentes e inofensivos podría estar incorporando una ética implícita de la abstención.
Finalmente, Atari, Xue, Park, Blasi y Henrich (2023) plantearon una pregunta de fondo con un título elocuente: ¿Qué humanos? Al comparar las respuestas psicológicas de los modelos con datos de decenas de países, encontraron que se parecían sobre todo a las de las poblaciones occidentales, educadas, industrializadas, ricas y democráticas (las llamadas sociedades WEIRD), y que la semejanza disminuía a medida que aumentaba la distancia cultural respecto a Estados Unidos. Cuando se dice que un modelo coincide con «los humanos», conviene preguntar siempre con cuáles.
6. Más allá de las respuestas: la influencia sobre las personas
Que un modelo tenga una orientación moral o ideológica sería una curiosidad académica si no influyera en quienes lo usan. Varios experimentos indican que sí influye, y que lo hace de maneras que las propias personas no siempre perciben.
Krügel, Ostermaier y Uhl (2023) preguntaron reiteradamente a ChatGPT si era correcto sacrificar a una persona para salvar a cinco y observaron que el modelo daba consejos contradictorios en distintas ocasiones, a favor y en contra. Después mostraron esos consejos a participantes humanos antes de que emitieran su propio juicio. Los participantes se dejaron influir por el consejo recibido, incluso sabiendo que procedía de un chatbot, y subestimaron cuánto les había influido. Los autores concluyen que el modelo amenaza con corromper el juicio moral de los usuarios en lugar de mejorarlo, y que la solución pasa más por la alfabetización digital que por confiar en que el sistema sea coherente.
Otros estudios muestran que las personas valoran muy positivamente los razonamientos morales de las máquinas. Aharoni et al. (2024) realizaron una versión modificada del test de Turing en el terreno moral: los participantes valoraron las evaluaciones morales de GPT-4 como superiores a las humanas en casi todas las dimensiones (virtud, inteligencia, fiabilidad), y paradójicamente pudieron identificar cuáles procedían de la máquina en parte porque parecían mejores. Dillion, Mondal, Tandon y Gray (2025) compararon los consejos de un modelo con los de un columnista especializado en ética de The New York Times, y los participantes consideraron los del modelo ligeramente más morales, fiables y reflexivos. Estos resultados plantean una cuestión filosófica de primer orden: ¿qué ocurre cuando una sociedad empieza a percibir a una máquina como una autoridad moral?
En el terreno político, Jakesch, Bhat, Buschek, Zalmanson y Naaman (2023) pidieron a participantes que escribieran un texto sobre si las redes sociales son buenas para la sociedad con ayuda de un asistente programado para sugerir una postura determinada. Los participantes no solo escribieron textos más favorables a esa postura, sino que su opinión personal, medida después, también se desplazó en esa dirección, sin que fueran conscientes de ello. Hackenburg y Margetts (2024) encontraron que los mensajes políticos generados por un modelo resultaban persuasivos, aunque adaptarlos al perfil individual de cada destinatario no aumentaba significativamente su eficacia. Costello, Pennycook y Rand (2024) informaron de que diálogos breves con un modelo reducían de forma duradera la creencia en teorías conspirativas; conviene advertir que la revista Science publicó en junio de 2026 una expresión de preocupación sobre este artículo por problemas en la gestión de los datos, aunque los autores sostienen que el análisis corregido confirma los resultados (Thorp, 2026). En conjunto, estos trabajos muestran que la capacidad persuasiva de los modelos puede servir tanto para fines que la mayoría consideraría valiosos como para otros que muchos considerarían manipuladores, y que la diferencia depende en gran medida de quién define qué es una creencia errónea.
Un último fenómeno complica el cuadro: la complacencia. Diversos estudios han mostrado que los modelos ajustados con preferencias humanas tienden a adaptar sus respuestas a lo que perciben como la opinión del usuario, dándole la razón aunque no la tenga (Perez et al., 2023; Sharma et al., 2024). Esto significa que un mismo modelo puede reforzar posiciones opuestas en usuarios distintos. Desde el punto de vista de la polarización, el riesgo no sería tanto que la máquina imponga una ideología única como que se convierta en un espejo que devuelve a cada cual su propia imagen, ahora con la aparente autoridad de un sistema que «lo sabe todo».
7. Límites metodológicos: ¿medimos lo que creemos medir?
Antes de extraer conclusiones normativas, conviene ser conscientes de las limitaciones de esta literatura, que sus propios autores suelen reconocer.
La primera es la validez de constructo. Los cuestionarios de orientación política y de fundamentos morales se diseñaron para personas, que responden desde una identidad relativamente estable. Aplicarlos a un sistema que puede adoptar cualquier perspectiva según la instrucción recibida plantea dudas sobre si el resultado mide una «posición» del modelo o simplemente la respuesta más probable a un formato de pregunta determinado (Röttger et al., 2024). Además, la clasificación de una respuesta como «de izquierdas» depende del propio test: aceptar que el cambio climático tiene origen humano aparece en algunos cuestionarios como indicador ideológico, aunque sea una afirmación respaldada por el consenso científico. Parte de la aparente inclinación de los modelos puede deberse, por tanto, a que se ajustan al conocimiento científico disponible en cuestiones que el debate político ha convertido en identitarias. Distinguir ambos componentes es metodológicamente difícil y políticamente delicado.
La segunda es la inestabilidad. Las respuestas cambian con la redacción de la pregunta, el idioma, el orden de las opciones y la versión del modelo (Cheung et al., 2025; Fujimoto y Takemoto, 2023). Un resultado obtenido con una versión de un modelo en 2023 puede no ser válido para la versión de 2026.
La tercera es la dependencia cultural de la vara de medir. La mayoría de los cuestionarios procede de Estados Unidos, y el eje izquierda-derecha estadounidense no se traslada sin problemas a otras sociedades. Lo que en Estados Unidos se considera progresista puede ser centrista en buena parte de Europa, y las categorías de «liberal» y «conservador» no significan lo mismo en Madrid que en Texas o en Pekín.
La cuarta es la distancia entre lo que el modelo dice cuando se le pregunta directamente y lo que hace cuando redacta, resume o aconseja. Las inclinaciones más relevantes desde el punto de vista ético pueden estar en las elecciones sutiles de encuadre, énfasis y omisión, que los cuestionarios no capturan.
Estas limitaciones no restan valor a la conclusión general (los modelos no son neutrales en sentido estricto y sus orientaciones pueden medirse e influir en las personas), pero desaconsejan las afirmaciones simplificadoras del tipo «el modelo X es de izquierdas» o «el modelo Y es conservador».
8. Reflexión filosófica: neutralidad, pluralismo y autonomía
8.1. La imposibilidad de la neutralidad perfecta
La conclusión filosófica más inmediata de los estudios revisados es que un modelo de lenguaje perfectamente neutral es imposible. No por falta de voluntad de sus diseñadores, sino por razones de principio. Todo sistema que responde preguntas debe decidir qué cuenta como un hecho y qué como una opinión, qué temas exigen presentar varias posturas y cuáles no, qué es una fuente fiable, qué lenguaje es respetuoso. Cada una de esas decisiones presupone valores. Un modelo que presentara «ambos lados» sobre si la esclavitud fue moralmente aceptable no sería neutral, sino que estaría adoptando una posición moral gravemente equivocada. Un modelo que se negara a responder cualquier pregunta con contenido normativo tampoco sería neutral: estaría transmitiendo implícitamente que todas las cuestiones morales son meras preferencias, lo cual es en sí una tesis filosófica discutible (un relativismo o un emotivismo).
Peters (2022) observa que el sesgo político de los algoritmos presenta un rasgo que lo distingue de otros sesgos, como los de género o raza: en nuestras sociedades está menos estigmatizado discriminar por ideas políticas que por origen étnico, y por ello es más fácil que pase inadvertido y que no se corrija. Además, a diferencia de lo que ocurre con el sexo o la raza, la ideología se infiere a menudo de manera indirecta, lo que hace el sesgo más difícil de detectar.
La filosofía política liberal ofrece una distinción útil para pensar este problema. John Rawls (1993) distinguía entre la neutralidad de efecto, que exigiría que las instituciones no favorezcan de hecho a ninguna concepción del bien, y la neutralidad de justificación o de propósito, que exige que las instituciones no se justifiquen apelando a la superioridad de una doctrina comprehensiva particular (religiosa, filosófica o moral) sobre las demás. La primera es imposible; la segunda es exigente pero alcanzable. Trasladada a los modelos de lenguaje, esta distinción sugiere que no debemos pedirles que no tengan ningún efecto ideológico, sino que sus valores puedan justificarse con razones que ciudadanos de muy distintas convicciones podrían aceptar: el respeto a los derechos humanos, la veracidad, la no discriminación, la protección frente a daños graves. En cambio, en las cuestiones que caen dentro del desacuerdo razonable (la política fiscal, la regulación del aborto, la inmigración, el papel de la religión) el modelo debería abstenerse de tomar partido y presentar con equidad las posiciones en conflicto.
8.2. El problema de los valores de quién
Gabriel (2020) formuló con precisión el dilema central del llamado «alineamiento» de la inteligencia artificial: alinear un sistema con los valores humanos exige decidir con qué valores, cuando los humanos discrepamos profundamente. Propone tres estrategias, inspiradas en la filosofía política, para afrontar el pluralismo: buscar un consenso entrecruzado entre distintas tradiciones sobre principios mínimos (por ejemplo, los derechos humanos), razonar tras un «velo de ignorancia» sobre qué principios elegiríamos si no supiéramos qué posición ocuparemos en la sociedad, o recurrir a mecanismos democráticos de elección social para agregar preferencias. Ninguna de las tres está exenta de dificultades, pero las tres comparten una idea: la legitimidad de los valores de un sistema que usan cientos de millones de personas no puede descansar únicamente en la decisión de una empresa privada.
Los estudios revisados muestran que, en la práctica, los valores de los modelos proceden en buena medida de un grupo reducido de evaluadores y de directrices redactadas por empresas radicadas mayoritariamente en Estados Unidos y China. El trabajo de Atari et al. (2023) sobre la «WEIRDización» de los modelos y el de Kirk et al. (2024), que recogió preferencias de unas 1.500 personas de 75 países y mostró profundas divergencias en lo que distintas poblaciones consideran una buena respuesta, apuntan en la misma dirección: el alineamiento actual tiende a universalizar una perspectiva particular. Desde la ética intercultural cabe hablar de una nueva forma de hegemonía cultural, no impuesta por la fuerza sino por la comodidad de un servicio útil y gratuito.
8.3. Autoridad moral, autonomía y desaprendizaje
La tradición ilustrada, desde Kant, ha entendido la autonomía moral como la capacidad de darse la ley a uno mismo mediante el uso público de la propia razón, y ha considerado una forma de minoría de edad la delegación del juicio en otros. Los estudios de Krügel et al. (2023), Aharoni et al. (2024) y Dillion et al. (2025) muestran que las personas se dejan influir por los consejos morales de las máquinas, que tienden a valorarlos muy positivamente y que no son plenamente conscientes de esa influencia. La combinación es delicada: una autoridad percibida como imparcial y superior, cuyo consejo puede ser inconsistente o sesgado, y cuya influencia el usuario subestima.
El riesgo no es solo que la máquina aconseje mal, sino que, aunque aconseje bien, debilite la capacidad de las personas para deliberar por sí mismas, del mismo modo que la calculadora ha erosionado la aritmética mental. Mittelstadt (2019) advirtió de que los principios éticos generales no bastan para garantizar una inteligencia artificial ética porque, a diferencia de la medicina, este ámbito carece de fines compartidos, de deberes profesionales consolidados y de mecanismos de rendición de cuentas. Floridi et al. (2018) incluyeron la autonomía entre los cinco principios de una buena sociedad de la inteligencia artificial, entendida como el equilibrio entre el poder de decisión que conservamos y el que delegamos. La pregunta ética no es si se debe consultar a las máquinas sobre cuestiones morales, sino cómo diseñarlas para que fortalezcan el juicio propio en lugar de sustituirlo: ofreciendo razones y no veredictos, presentando la diversidad de posiciones razonables y devolviendo la decisión al usuario.
8.4. El mimetismo moral y la cuestión de la sinceridad
El fenómeno del «mimetismo moral» descrito por Simmons (2023) y la complacencia documentada por Sharma et al. (2024) plantean una cuestión filosófica de otro orden: la de la sinceridad. Un interlocutor humano que adapta sus convicciones morales a quien tiene delante sería calificado de hipócrita o adulador. ¿Puede aplicarse ese juicio a una máquina? Kasirzadeh y Gabriel (2023) proponen pensar el problema a partir de las normas de la conversación: en una conversación científica rige ante todo la veracidad; en una deliberación democrática, el respeto mutuo y la disposición a dar razones; en una conversación creativa, otras normas. Un modelo bien alineado no sería el que tiene «opiniones correctas», sino el que respeta las normas propias de cada tipo de conversación. Desde esta perspectiva, la complacencia es un defecto moral del sistema no porque el modelo «mienta» en sentido estricto, sino porque defrauda la expectativa legítima de un usuario que consulta a un interlocutor que presume honesto.
8.5. ¿Una ética de la abstención?
El hallazgo de Cheung et al. (2025) sobre el sesgo de omisión amplificado invita a una reflexión adicional. El ajuste de los modelos persigue que sean inofensivos, y una manera sencilla de no causar daño es no hacer nada. Pero la ética no se reduce a evitar daños: en muchas situaciones no actuar es también una decisión con consecuencias, y la tradición moral ha discutido durante siglos si existe una diferencia moral relevante entre hacer y dejar hacer. Un sistema que, por diseño, se inclina sistemáticamente hacia la omisión está incorporando implícitamente una posición en ese debate, próxima a ciertas versiones de la ética deontológica y alejada del consecuencialismo. Es un ejemplo de cómo decisiones de ingeniería motivadas por la prudencia comercial pueden traducirse en compromisos filosóficos que nadie ha debatido abiertamente.
9. Dimensión jurídica
9.1. El marco constitucional y europeo
La orientación ideológica de los sistemas de inteligencia artificial afecta a bienes jurídicos de primer orden. La Constitución española proclama el pluralismo político como valor superior del ordenamiento jurídico (art. 1.1), garantiza la libertad ideológica (art. 16) y protege la libertad de expresión y el derecho a recibir libremente información veraz (art. 20). El propio artículo 20.3 exige que el acceso a los medios de comunicación de titularidad pública respete el pluralismo de la sociedad. Los asistentes conversacionales no son medios públicos, pero cumplen una función creciente en la formación de la opinión pública, lo que justifica preguntarse si deben quedar sujetos a obligaciones análogas de pluralismo y transparencia. La Carta de los Derechos Fundamentales de la Unión Europea reconoce igualmente la libertad de pensamiento (art. 10) y la libertad de expresión e información, con la mención expresa del respeto a la libertad de los medios y su pluralismo (art. 11).
9.2. El Reglamento europeo de Inteligencia Artificial
El Reglamento (UE) 2024/1689, conocido como Reglamento de Inteligencia Artificial, no regula directamente la «ideología» de los modelos, pero contiene varias disposiciones relevantes. Su artículo 5 prohíbe los sistemas que utilicen técnicas subliminales, manipuladoras o engañosas con el objetivo o el efecto de alterar de manera sustancial el comportamiento de las personas, mermando su capacidad de tomar una decisión informada, cuando ello cause o pueda causar perjuicios considerables. El anexo III califica como de alto riesgo los sistemas destinados a influir en el resultado de elecciones o referendos o en el comportamiento electoral de las personas. El artículo 50 impone obligaciones de transparencia, como informar a las personas de que interactúan con un sistema de inteligencia artificial. Y los artículos 53 y 55 establecen obligaciones específicas para los proveedores de modelos de uso general, que en el caso de los modelos con riesgo sistémico incluyen evaluar y mitigar riesgos que pueden afectar, entre otros ámbitos, a los procesos democráticos.
A ello se suma el Reglamento de Servicios Digitales (Reglamento [UE] 2022/2065), cuyo artículo 34 obliga a las grandes plataformas a evaluar los riesgos sistémicos para el discurso cívico y los procesos electorales, una obligación que podría extenderse a los asistentes integrados en tales plataformas. En el ámbito del Consejo de Europa, el Convenio Marco sobre Inteligencia Artificial y Derechos Humanos, Democracia y Estado de Derecho (2024) exige a los Estados adoptar medidas para que los sistemas de inteligencia artificial no se utilicen para socavar la integridad de los procesos democráticos.
9.3. Tensiones y paradojas regulatorias
El tratamiento jurídico de la ideología de las máquinas plantea paradojas que conviene explicitar. La primera es que exigir neutralidad por vía legal puede convertirse en una forma de imposición ideológica. Si el Estado define qué cuenta como respuesta «neutral», está fijando un criterio que inevitablemente será discutido. En Estados Unidos, una orden ejecutiva de julio de 2025 exigió que los modelos adquiridos por la Administración federal fueran «ideológicamente neutrales» y «buscadores de la verdad», y excluyó expresamente determinados enfoques sobre diversidad e inclusión (Executive Office of the President, 2025). Sus defensores la presentan como una garantía frente al sesgo progresista documentado en los estudios; sus críticos sostienen que sustituye un sesgo por otro y que el poder político define qué es la verdad. Con independencia de cómo se valore, el caso ilustra la dificultad de legislar la neutralidad sin tomar partido.
La segunda paradoja afecta a la libertad de expresión de las empresas. Si los resultados de un modelo se consideran una forma de expresión de su desarrollador, las exigencias de pluralismo podrían colisionar con la libertad de expresión de este, del mismo modo que no se exige a un periódico que sea imparcial. La analogía, sin embargo, cojea: un periódico declara su línea editorial y compite con otros en un mercado plural, mientras que un asistente conversacional se presenta como una herramienta de propósito general y de apariencia neutral, y el mercado está muy concentrado. Esto sugiere que la exigencia jurídica más razonable no es la neutralidad, sino la transparencia sobre los valores incorporados y la pluralidad de la oferta.
La tercera paradoja es probatoria. Como se ha visto en el apartado 7, medir la orientación de un modelo es metodológicamente difícil y los resultados son inestables. Una regulación que imponga obligaciones de neutralidad necesita instrumentos de verificación fiables, que aún no existen de forma consolidada. De ahí la importancia de fomentar auditorías independientes, el acceso de investigadores a los modelos y la publicación de los principios que guían su comportamiento.
10. Conclusiones
La respuesta a la pregunta que motivó este ensayo es inequívoca: existen numerosos estudios experimentales que han interrogado a los grandes modelos de lenguaje con preguntas que exigen un posicionamiento moral y que pueden revelar una ideología. Esta literatura, desarrollada principalmente entre 2022 y 2026, permite extraer varias conclusiones con un grado razonable de confianza:
Los modelos conversacionales más utilizados tienden, cuando se les aplican cuestionarios políticos, a situarse a la izquierda del centro y en posiciones socialmente liberales, sobre todo en sus primeras versiones, aunque esta inclinación varía entre modelos y versiones y se ha atenuado en algunos casos.
Sus juicios morales coinciden en gran medida con el sentido común moral de las sociedades occidentales, educadas y ricas, y se alejan de los de otras culturas.
La principal fuente de estas orientaciones parece ser el ajuste con preferencias humanas, más que los datos de entrenamiento por sí solos, lo que significa que son en parte el resultado de decisiones humanas identificables.
Las respuestas son muy sensibles a la formulación de la pregunta, de modo que la «moral» de un modelo es menos una brújula estable que una disposición dependiente del contexto.
Los modelos influyen en el juicio moral y en las opiniones políticas de los usuarios, a menudo sin que estos sean conscientes, y tienden a ser percibidos como autoridades morales fiables.
Desde la filosofía moral y política, estos hallazgos obligan a abandonar el ideal ingenuo de una máquina sin valores y a sustituirlo por exigencias más realistas: neutralidad de justificación en las cuestiones de desacuerdo razonable, firmeza en los mínimos morales compartidos, transparencia sobre los principios incorporados, respeto a la autonomía deliberativa del usuario y legitimidad democrática en la definición de los valores de sistemas que funcionan como infraestructuras sociales. Desde el derecho, el marco europeo ofrece instrumentos útiles, centrados en la prohibición de la manipulación, la protección de los procesos democráticos y la transparencia, pero aún no da respuesta a la cuestión de fondo de quién debe decidir los valores de las máquinas y con qué controles.
Quedan abiertas preguntas importantes para la investigación futura: cómo medir la orientación valorativa en el uso real y no solo en cuestionarios; cómo varía en lenguas distintas del inglés, incluido el español; qué efectos acumulados tiene sobre la opinión pública una exposición prolongada; y cómo diseñar procedimientos participativos y plurales para definir los valores de los sistemas. Para una universidad pública, estas preguntas no son solo objeto de estudio: afectan también a cómo se forma a quienes usarán estas herramientas para aprender, investigar y deliberar.
En última instancia, los modelos de lenguaje funcionan como un espejo de la sociedad que los produce, pero no de toda ella por igual, sino de unos sectores más que de otros, y con un pulido que eligen sus fabricantes. La tarea ética no consiste en romper el espejo ni en exigirle una imposible transparencia absoluta, sino en saber qué refleja, quién lo ha pulido y qué parte de la imagen queda fuera.
Referencias
Abdulhai, M., Serapio-García, G., Crepy, C., Valter, D., Canny, J. y Jaques, N. (2024). Moral foundations of large language models. En Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing (pp. 17737–17752). Association for Computational Linguistics. https://doi.org/10.18653/v1/2024.emnlp-main.982
Aharoni, E., Fernandes, S., Brady, D. J., Alexander, C., Criner, M., Queen, K., Rando, J., Nahmias, E. y Crespo, V. (2024). Attributions toward artificial agents in a modified Moral Turing Test. Scientific Reports, 14, Artículo 8458. https://doi.org/10.1038/s41598-024-58087-7
Atari, M., Xue, M. J., Park, P. S., Blasi, D. E. y Henrich, J. (2023). Which humans? [Preprint]. PsyArXiv. https://doi.org/10.31234/osf.io/5b26t
Awad, E., Dsouza, S., Kim, R., Schulz, J., Henrich, J., Shariff, A., Bonnefon, J.-F. y Rahwan, I. (2018). The Moral Machine experiment. Nature, 563(7729), 59–64. https://doi.org/10.1038/s41586-018-0637-6
Bai, Y., Kadavath, S., Kundu, S., Askell, A., Kernion, J., Jones, A., Chen, A., Goldie, A., Mirhoseini, A., McKinnon, C., Chen, C., Olsson, C., Olah, C., Hernandez, D., Drain, D., Ganguli, D., Li, D., Tran-Johnson, E., Perez, E., … Kaplan, J. (2022). Constitutional AI: Harmlessness from AI feedback [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2212.08073
Bender, E. M., Gebru, T., McMillan-Major, A. y Shmitchell, S. (2021). On the dangers of stochastic parrots: Can language models be too big? En Proceedings of the 2021 ACM Conference on Fairness, Accountability, and Transparency (pp. 610–623). Association for Computing Machinery. https://doi.org/10.1145/3442188.3445922
Buyl, M., Rogiers, A., Noels, S., Bied, G., Dominguez-Catena, I., Heiter, E., Johary, I., Mara, A.-C., Romero, R., Lijffijt, J. y De Bie, T. (2026). Large language models reflect the ideology of their creators. npj Artificial Intelligence, 2, Artículo 7. https://doi.org/10.1038/s44387-025-00048-0
Cheung, V., Maier, M. y Lieder, F. (2025). Large language models show amplified cognitive biases in moral decision-making. Proceedings of the National Academy of Sciences, 122(25), Artículo e2412015122. https://doi.org/10.1073/pnas.2412015122
Consejo de Europa. (2024). Convenio Marco del Consejo de Europa sobre Inteligencia Artificial y Derechos Humanos, Democracia y Estado de Derecho (Serie de Tratados del Consejo de Europa n.º 225). https://www.coe.int/en/web/artificial-intelligence/the-framework-convention-on-artificial-intelligence
Constitución Española. Boletín Oficial del Estado, 311, de 29 de diciembre de 1978. https://www.boe.es/eli/es/c/1978/12/27/(1)/con
Costello, T. H., Pennycook, G. y Rand, D. G. (2024). Durably reducing conspiracy beliefs through dialogues with AI. Science, 385(6714), Artículo eadq1814. https://doi.org/10.1126/science.adq1814
Dillion, D., Mondal, D., Tandon, N. y Gray, K. (2025). AI language model rivals expert ethicist in perceived moral expertise. Scientific Reports, 15, Artículo 4084. https://doi.org/10.1038/s41598-025-86510-0
Dillion, D., Tandon, N., Gu, Y. y Gray, K. (2023). Can AI language models replace human participants? Trends in Cognitive Sciences, 27(7), 597–600. https://doi.org/10.1016/j.tics.2023.04.008
Durmus, E., Nguyen, K., Liao, T. I., Schiefer, N., Askell, A., Bakhtin, A., Chen, C., Hatfield-Dodds, Z., Hernandez, D., Joseph, N., Lovitt, L., McCandlish, S., Sikder, O., Tamkin, A., Thamkul, J., Kaplan, J., Clark, J. y Ganguli, D. (2023). Towards measuring the representation of subjective global opinions in language models [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2306.16388
Executive Office of the President. (2025, 23 de julio). Preventing woke AI in the federal government (Orden ejecutiva 14319). The White House. https://www.whitehouse.gov/presidential-actions/2025/07/preventing-woke-ai-in-the-federal-government/
Feng, S., Park, C. Y., Liu, Y. y Tsvetkov, Y. (2023). From pretraining data to language models to downstream tasks: Tracking the trails of political biases leading to unfair NLP models. En Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) (pp. 11737–11762). Association for Computational Linguistics. https://doi.org/10.18653/v1/2023.acl-long.656
Floridi, L., Cowls, J., Beltrametti, M., Chatila, R., Chazerand, P., Dignum, V., Luetge, C., Madelin, R., Pagallo, U., Rossi, F., Schafer, B., Valcke, P. y Vayena, E. (2018). AI4People—An ethical framework for a good AI society: Opportunities, risks, principles, and recommendations. Minds and Machines, 28(4), 689–707. https://doi.org/10.1007/s11023-018-9482-5
Fujimoto, S. y Takemoto, K. (2023). Revisiting the political biases of ChatGPT. Frontiers in Artificial Intelligence, 6, Artículo 1232003. https://doi.org/10.3389/frai.2023.1232003
Gabriel, I. (2020). Artificial intelligence, values, and alignment. Minds and Machines, 30(3), 411–437. https://doi.org/10.1007/s11023-020-09539-2
Graham, J., Haidt, J. y Nosek, B. A. (2009). Liberals and conservatives rely on different sets of moral foundations. Journal of Personality and Social Psychology, 96(5), 1029–1046. https://doi.org/10.1037/a0015141
Hackenburg, K. y Margetts, H. (2024). Evaluating the persuasive influence of political microtargeting with large language models. Proceedings of the National Academy of Sciences, 121(24), Artículo e2403116121. https://doi.org/10.1073/pnas.2403116121
Haidt, J. (2001). The emotional dog and its rational tail: A social intuitionist approach to moral judgment. Psychological Review, 108(4), 814–834. https://doi.org/10.1037/0033-295X.108.4.814
Hartmann, J., Schwenzow, J. y Witte, M. (2023). The political ideology of conversational AI: Converging evidence on ChatGPT's pro-environmental, left-libertarian orientation [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2301.01768
Hendrycks, D., Burns, C., Basart, S., Critch, A., Li, J., Song, D. y Steinhardt, J. (2021). Aligning AI with shared human values. En International Conference on Learning Representations (ICLR 2021). https://doi.org/10.48550/arXiv.2008.02275
Jakesch, M., Bhat, A., Buschek, D., Zalmanson, L. y Naaman, M. (2023). Co-writing with opinionated language models affects users' views. En Proceedings of the 2023 CHI Conference on Human Factors in Computing Systems (pp. 1–15). Association for Computing Machinery. https://doi.org/10.1145/3544548.3581196
Jiang, L., Hwang, J. D., Bhagavatula, C., Le Bras, R., Liang, J. T., Levine, S., Dodge, J., Sakaguchi, K., Forbes, M., Hessel, J., Borchardt, J., Sorensen, T., Gabriel, S., Tsvetkov, Y., Etzioni, O., Sap, M., Rini, R. y Choi, Y. (2025). Investigating machine moral judgement through the Delphi experiment. Nature Machine Intelligence, 7(1), 145–160. https://doi.org/10.1038/s42256-024-00969-6
Kasirzadeh, A. y Gabriel, I. (2023). In conversation with artificial intelligence: Aligning language models with human values. Philosophy & Technology, 36(2), Artículo 27. https://doi.org/10.1007/s13347-023-00606-x
Kirk, H. R., Whitefield, A., Röttger, P., Bean, A., Margatina, K., Ciro, J., Mosquera, R., Bartolo, M., Williams, A., He, H., Vidgen, B. y Hale, S. A. (2024). The PRISM alignment dataset: What participatory, representative and individualised human feedback reveals about the subjective and multicultural alignment of large language models. En Advances in Neural Information Processing Systems, 37 (pp. 105236–105344). https://doi.org/10.52202/079017-3342
Krügel, S., Ostermaier, A. y Uhl, M. (2023). ChatGPT's inconsistent moral advice influences users' judgment. Scientific Reports, 13, Artículo 4569. https://doi.org/10.1038/s41598-023-31341-0
Mittelstadt, B. (2019). Principles alone cannot guarantee ethical AI. Nature Machine Intelligence, 1(11), 501–507. https://doi.org/10.1038/s42256-019-0114-4
Motoki, F., Pinho Neto, V. y Rodrigues, V. (2024). More human than human: Measuring ChatGPT political bias. Public Choice, 198(1–2), 3–23. https://doi.org/10.1007/s11127-023-01097-2
Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C. L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L., Simens, M., Askell, A., Welinder, P., Christiano, P., Leike, J. y Lowe, R. (2022). Training language models to follow instructions with human feedback. En Advances in Neural Information Processing Systems, 35 (pp. 27730–27744). https://doi.org/10.48550/arXiv.2203.02155
Perez, E., Ringer, S., Lukošiūtė, K., Nguyen, K., Chen, E., Heiner, S., Pettit, C., Olsson, C., Kundu, S., Kadavath, S., Jones, A., Chen, A., Mann, B., Israel, B., Seethor, B., McKinnon, C., Olah, C., Yan, D., Amodei, D., … Kaplan, J. (2023). Discovering language model behaviors with model-written evaluations. En Findings of the Association for Computational Linguistics: ACL 2023 (pp. 13387–13434). Association for Computational Linguistics. https://doi.org/10.18653/v1/2023.findings-acl.847
Peters, U. (2022). Algorithmic political bias in artificial intelligence systems. Philosophy & Technology, 35(2), Artículo 25. https://doi.org/10.1007/s13347-022-00512-8
Rawls, J. (1993). Political liberalism. Columbia University Press.
Reglamento (UE) 2022/2065 del Parlamento Europeo y del Consejo, de 19 de octubre de 2022, relativo a un mercado único de servicios digitales (Reglamento de Servicios Digitales). Diario Oficial de la Unión Europea, L 277, 1–102. http://data.europa.eu/eli/reg/2022/2065/oj
Reglamento (UE) 2024/1689 del Parlamento Europeo y del Consejo, de 13 de junio de 2024, por el que se establecen normas armonizadas en materia de inteligencia artificial (Reglamento de Inteligencia Artificial). Diario Oficial de la Unión Europea, L, 2024/1689. http://data.europa.eu/eli/reg/2024/1689/oj
Röttger, P., Hofmann, V., Pyatkin, V., Hinck, M., Kirk, H. R., Schütze, H. y Hovy, D. (2024). Political compass or spinning arrow? Towards more meaningful evaluations for values and opinions in large language models. En Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) (pp. 15295–15311). Association for Computational Linguistics. https://doi.org/10.18653/v1/2024.acl-long.816
Rozado, D. (2023). The political biases of ChatGPT. Social Sciences, 12(3), Artículo 148. https://doi.org/10.3390/socsci12030148
Rozado, D. (2024). The political preferences of LLMs. PLOS ONE, 19(7), Artículo e0306621. https://doi.org/10.1371/journal.pone.0306621
Santurkar, S., Durmus, E., Ladhak, F., Lee, C., Liang, P. y Hashimoto, T. (2023). Whose opinions do language models reflect? En Proceedings of the 40th International Conference on Machine Learning (PMLR 202, pp. 29971–30004). https://doi.org/10.48550/arXiv.2303.17548
Scherrer, N., Shi, C., Feder, A. y Blei, D. M. (2023). Evaluating the moral beliefs encoded in LLMs. En Advances in Neural Information Processing Systems, 36. https://doi.org/10.48550/arXiv.2307.14324
Schramowski, P., Turan, C., Andersen, N., Rothkopf, C. A. y Kersting, K. (2022). Large pre-trained language models contain human-like biases of what is right and wrong to do. Nature Machine Intelligence, 4(3), 258–268. https://doi.org/10.1038/s42256-022-00458-8
Sharma, M., Tong, M., Korbak, T., Duvenaud, D., Askell, A., Bowman, S. R., Cheng, N., Durmus, E., Hatfield-Dodds, Z., Johnston, S. R., Kravec, S., Maxwell, T., McCandlish, S., Ndousse, K., Rausch, O., Schiefer, N., Yan, D., Zhang, M. y Perez, E. (2024). Towards understanding sycophancy in language models. En International Conference on Learning Representations (ICLR 2024). https://doi.org/10.48550/arXiv.2310.13548
Simmons, G. (2023). Moral mimicry: Large language models produce moral rationalizations tailored to political identity. En Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 4: Student Research Workshop) (pp. 282–297). Association for Computational Linguistics. https://doi.org/10.18653/v1/2023.acl-srw.40
Takemoto, K. (2024). The moral machine experiment on large language models. Royal Society Open Science, 11(2), Artículo 231393. https://doi.org/10.1098/rsos.231393
Thorp, H. H. (2026). Editorial expression of concern. Science, 392(6803). https://doi.org/10.1126/science.aej2383
Este texto ha sido redactado con ayuda de Inteligencia Artificial



