La aplicación de la Inteligencia Artificial en Medicina, y Psiquiatría, Legal: "el perito aumentado"

Resumen
La irrupción de la inteligencia artificial (IA), y en particular de los modelos de lenguaje de gran tamaño, está alterando la forma en que se genera, se organiza y se comunica el conocimiento médico. La prueba pericial médica, pieza central de numerosos procesos civiles, penales, laborales y contencioso-administrativos, no es ajena a esa transformación.
Este ensayo examina, en primer lugar, la naturaleza jurídica y epistémica del informe pericial y las exigencias que el ordenamiento español impone al perito. En segundo lugar, revisa el estado de la evidencia sobre aplicaciones de IA en las principales áreas de la medicina legal: patología forense e imagen postmortem, estimación del intervalo postmortem, toxicología, clínica médico-forense y valoración del daño corporal, antropología y odontología forense, genética y responsabilidad profesional sanitaria. En tercer lugar, dedica un análisis específico a la psiquiatría forense —imputabilidad, capacidad, valoración del riesgo de violencia, detección de simulación y análisis automatizado del lenguaje—, por ser el ámbito en el que la dimensión interpretativa y relacional del peritaje resulta más acusada. Por último, aborda la hipótesis de un informe pericial íntegramente elaborado por IA, sin intervención humana, y concluye que, en el estado actual de la técnica y del derecho, tal escenario es jurídicamente inviable, epistémicamente prematuro y éticamente desaconsejable, aunque la IA puede y debe integrarse como herramienta de apoyo bajo un modelo de «perito aumentado» con supervisión humana efectiva, trazabilidad y transparencia.
1. Introducción
El informe pericial médico ocupa una posición singular en la Administración de Justicia. A través de él, un saber especializado —el de la medicina— se pone al servicio de un órgano que carece de ese saber, el juez o tribunal, para que pueda conocer o apreciar hechos relevantes para la resolución de un litigio. El perito no decide; ilustra. Pero su ilustración, en la práctica, condiciona de forma decisiva la decisión judicial en materias tan diversas como la causa y la data de una muerte, la gravedad de unas lesiones, la existencia de mala praxis, la capacidad de una persona para regir su vida o la imputabilidad de quien ha cometido un delito.
Durante la última década, la medicina ha incorporado de forma creciente herramientas de inteligencia artificial capaces de igualar o superar el rendimiento de especialistas humanos en tareas acotadas de reconocimiento de patrones, especialmente en imagen médica (Esteva et al., 2017; Topol, 2019). Desde finales de 2022, la aparición de modelos de lenguaje de gran tamaño (en adelante, LLM, por sus siglas en inglés) accesibles al público ha añadido una dimensión nueva: sistemas capaces de redactar textos clínicos coherentes, responder preguntas médicas complejas y superar exámenes de licenciatura médica (Kung et al., 2023; Lee et al., 2023; Singhal et al., 2023; Thirunavukarasu et al., 2023). La pregunta de si estas herramientas pueden asistir al perito médico —o incluso sustituirlo— ha dejado de ser especulativa.
La medicina legal y forense es, por su propia naturaleza, una disciplina de síntesis: integra conocimientos de patología, radiología, toxicología, genética, traumatología, psiquiatría y prácticamente cualquier especialidad clínica, y los traduce a categorías jurídicas. Esta posición de frontera la hace especialmente receptiva a la IA, pero también especialmente vulnerable a sus riesgos. Un error diagnóstico en la clínica afecta a un paciente; un error pericial puede afectar a la libertad de una persona, a la reparación debida a una víctima o a la credibilidad del propio sistema judicial.
El objetivo de este ensayo es triple. Primero, ofrecer un mapa razonado de las aplicaciones actuales y previsibles de la IA en la elaboración de informes periciales en las distintas áreas de la medicina legal. Segundo, analizar con detenimiento el caso de la psiquiatría forense, cuyas particularidades epistemológicas y éticas la convierten en un terreno de prueba especialmente exigente. Tercero, someter a examen crítico la hipótesis más radical: la de un informe pericial generado íntegramente por un sistema de IA, sin intervención humana sustantiva. El análisis se sitúa preferentemente en el marco del derecho español y europeo, con referencias comparadas cuando resultan ilustrativas.
2. La prueba pericial médica: naturaleza, función y exigencias
2.1. El perito y su informe en el ordenamiento español
En el proceso civil, la Ley de Enjuiciamiento Civil (LEC) configura el dictamen pericial como un medio de prueba que procede cuando sean necesarios conocimientos científicos, artísticos, técnicos o prácticos para valorar hechos o circunstancias relevantes (art. 335.1 LEC). El perito debe manifestar, bajo juramento o promesa de decir verdad, que ha actuado y actuará con la mayor objetividad posible, tomando en consideración tanto lo que pueda favorecer como lo que sea susceptible de causar perjuicio a cualquiera de las partes, y que conoce las sanciones penales en que podría incurrir si incumpliere su deber (art. 335.2 LEC). La ley exige, además, que los peritos posean el título oficial correspondiente a la materia objeto del dictamen (art. 340.1 LEC), prevé su presencia en juicio para explicar, aclarar o ampliar el dictamen y responder a preguntas y objeciones (art. 347 LEC) y somete su valoración a las reglas de la sana crítica (art. 348 LEC) (Ley 1/2000).
En el proceso penal, la Ley de Enjuiciamiento Criminal (LECrim) dispone que el juez acordará el informe pericial cuando, para conocer o apreciar algún hecho o circunstancia importante en el sumario, fuesen necesarios o convenientes conocimientos científicos o artísticos (art. 456 LECrim). El informe debe comprender la descripción de la persona o cosa objeto del mismo, la relación detallada de las operaciones practicadas y de su resultado, y las conclusiones que formulen los peritos conforme a los principios y reglas de su ciencia o arte (art. 478 LECrim). La prueba pericial practicada en la fase de instrucción debe, como regla general, reproducirse en el juicio oral bajo los principios de inmediación, oralidad y contradicción (Real Decreto de 14 de septiembre de 1882). A ello se añade que el Código Penal tipifica como delito la conducta del perito que faltare a la verdad maliciosamente en su dictamen (art. 459 del Código Penal; Ley Orgánica 10/1995).
De este marco normativo se desprenden varias notas que resultan decisivas para el análisis posterior. El perito es una persona física, cualificada profesionalmente, que asume un compromiso personal de objetividad, cuya actuación está sujeta a responsabilidad —incluso penal— y que debe poder ser interrogada y contradicha en presencia del juez. El informe no es solo un documento: es la expresión documentada de un juicio profesional del que alguien responde.
2.2. Las exigencias epistémicas: fiabilidad, transparencia y contradicción
Más allá de los requisitos formales, la doctrina y la jurisprudencia comparadas han subrayado que el valor probatorio de una pericia depende de la fiabilidad del método empleado. En Estados Unidos, la sentencia del Tribunal Supremo en el caso Daubert v. Merrell Dow Pharmaceuticals, Inc. (1993) encomendó al juez una función de control (gatekeeping) sobre la admisibilidad de la prueba científica, sugiriendo criterios como la posibilidad de contrastar empíricamente la técnica, su sometimiento a revisión por pares, la tasa de error conocida o potencial, la existencia de estándares que controlen su aplicación y su aceptación general en la comunidad científica relevante. Aunque el derecho español no ha incorporado formalmente estos criterios, la valoración conforme a la sana crítica exige, de hecho, que el tribunal pueda comprender en qué se basan las conclusiones del perito y por qué son razonables.
Estos criterios adquieren una relevancia particular cuando la herramienta utilizada es un sistema de IA. Muchos modelos de aprendizaje profundo funcionan como «cajas negras» cuyo razonamiento interno no resulta accesible ni siquiera para sus desarrolladores. Se ha argumentado con fuerza que, en decisiones de alto riesgo, deberían preferirse modelos intrínsecamente interpretables en lugar de intentar explicar a posteriori modelos opacos (Rudin, 2019), y que las técnicas actuales de «IA explicable» ofrecen en el ámbito sanitario garantías mucho menores de lo que a menudo se supone (Ghassemi et al., 2021). En el contexto forense, donde la contradicción entre partes es la vía principal de control de la prueba, la opacidad no es un mero inconveniente técnico: compromete el derecho de defensa.
2.3. El factor humano: sesgos cognitivos en la pericia
Sería ingenuo idealizar al perito humano. Una abundante literatura ha documentado que los expertos forenses son vulnerables a sesgos cognitivos que pueden distorsionar sus conclusiones. Dror y Hampikian (2011) mostraron que analistas de ADN que examinaron una misma mezcla genética sin información contextual del caso llegaban a conclusiones dispares, y en su mayoría distintas de las alcanzadas originalmente por los peritos que sí conocían el contexto. Dror (2020) sistematizó posteriormente seis falacias habituales entre los expertos —entre ellas, la creencia de que el sesgo solo afecta a personas poco éticas o incompetentes, o la de que la experiencia y la tecnología lo eliminan— y ocho fuentes de sesgo que operan en distintos niveles del razonamiento experto.
En el terreno de la salud mental forense, Murrie et al. (2013) demostraron el denominado «sesgo de adscripción» (allegiance effect): evaluadores que puntuaban los mismos casos con instrumentos estandarizados de riesgo obtenían puntuaciones sistemáticamente más altas cuando creían haber sido contratados por la acusación que cuando creían trabajar para la defensa. Zapf et al. (2018), en una encuesta a evaluadores forenses, observaron que la mayoría reconocía la existencia de sesgos en su disciplina, pero una proporción considerablemente menor los admitía en su propia práctica, fenómeno conocido como «punto ciego del sesgo».
Esta evidencia es relevante en dos sentidos opuestos. Por un lado, constituye el argumento más poderoso a favor de incorporar herramientas automatizadas que, en principio, no conocen quién paga el informe ni se dejan influir por el relato emocional del caso. Por otro, advierte de que la IA no está libre de sesgos: simplemente los traslada a otro lugar —los datos de entrenamiento, el diseño del modelo, la formulación de la pregunta— donde pueden resultar más difíciles de detectar.
3. La inteligencia artificial: conceptos útiles para el perito médico
3.1. Aprendizaje automático y aprendizaje profundo
Bajo la etiqueta de «inteligencia artificial» se agrupan técnicas muy heterogéneas. Para el perito médico interesa distinguir, al menos, entre los sistemas de aprendizaje automático (machine learning) entrenados para tareas específicas —clasificar una imagen, estimar una edad, predecir un riesgo— y los modelos generativos de propósito general. Los primeros aprenden a partir de grandes conjuntos de datos etiquetados y pueden alcanzar un rendimiento notable en tareas acotadas. El trabajo de Esteva et al. (2017), en el que una red neuronal convolucional entrenada con cerca de 130.000 imágenes clínicas clasificó lesiones cutáneas con un rendimiento comparable al de médicos dermatólogos, se convirtió en un hito que anticipaba la llamada «medicina de alto rendimiento» basada en la convergencia entre inteligencia humana y artificial (Topol, 2019).
Para la prueba pericial, este tipo de sistemas tiene una ventaja importante: sus métricas de rendimiento (sensibilidad, especificidad, error medio, área bajo la curva) pueden medirse y comunicarse, lo que permite, al menos en teoría, satisfacer el criterio de tasa de error conocida. Su principal limitación es la validez externa: un modelo entrenado en una población, con un tipo de equipo o en un contexto clínico determinado puede comportarse de forma impredecible cuando se aplica a casos que difieren de los de entrenamiento.
3.2. Modelos de lenguaje de gran tamaño
Los LLM son modelos generativos entrenados con enormes corpus de texto para predecir secuencias de palabras. Su capacidad para producir textos fluidos y aparentemente razonados ha generado un entusiasmo considerable en medicina. Singhal et al. (2023) mostraron que estos modelos codifican una cantidad sustancial de conocimiento clínico y pueden alcanzar resultados elevados en preguntas de tipo examen médico, aunque con deficiencias relevantes cuando sus respuestas eran evaluadas por clínicos en dimensiones como la posibilidad de causar daño o la omisión de información importante. Kung et al. (2023) observaron que ChatGPT se situaba en el umbral de aprobado del examen de licencia médica estadounidense (USMLE) sin entrenamiento específico. Ayers et al. (2023), por su parte, encontraron que evaluadores profesionales preferían las respuestas de un chatbot a preguntas de pacientes frente a las de médicos, tanto por su calidad como por su empatía percibida.
Las revisiones de conjunto coinciden en el potencial de estos sistemas para tareas de documentación, síntesis de información y apoyo a la decisión, pero también en la necesidad de cautela ante sus errores, la falta de transparencia sobre sus datos de entrenamiento y los riesgos para la privacidad (Lee et al., 2023; Thirunavukarasu et al., 2023). Para el perito, la tentación es evidente: un LLM puede resumir en minutos una historia clínica de cientos de páginas, ordenar cronológicamente los hechos asistenciales, proponer una estructura de informe y redactar un borrador con apariencia profesional. Precisamente esa apariencia constituye su mayor peligro.
3.3. Limitaciones estructurales: alucinaciones, opacidad, sesgo y automatización
Cuatro limitaciones merecen especial atención en el contexto pericial.
La primera son las denominadas «alucinaciones»: la generación de contenido falso con apariencia verosímil. Alkaissi y McFarlane (2023) documentaron cómo ChatGPT producía explicaciones médicas plausibles pero erróneas, acompañadas de referencias bibliográficas inexistentes. Walters y Wilder (2023) cuantificaron el fenómeno: una proporción sustancial de las citas bibliográficas generadas por estos modelos eran inventadas o contenían errores relevantes, aunque la proporción disminuía en las versiones más recientes. El riesgo dejó de ser teórico en el ámbito judicial con el caso Mata v. Avianca, Inc. (2023), en el que un tribunal federal estadounidense sancionó a varios abogados por presentar un escrito que citaba precedentes judiciales inexistentes generados por ChatGPT. Un informe pericial que incorporase datos, porcentajes o referencias alucinadas podría inducir a error al tribunal y, eventualmente, comprometer la responsabilidad del perito.
La segunda es la opacidad, ya mencionada, que dificulta la contradicción. La tercera es el sesgo algorítmico. Obermeyer et al. (2019) demostraron que un algoritmo ampliamente utilizado en Estados Unidos para asignar recursos sanitarios discriminaba a pacientes negros porque empleaba el gasto sanitario previo como indicador de necesidad clínica, de modo que, a igual puntuación de riesgo, esos pacientes estaban en realidad más enfermos. El ejemplo ilustra cómo decisiones técnicas aparentemente neutras pueden reproducir desigualdades estructurales, un problema que en el ámbito forense —donde las poblaciones evaluadas no son representativas de la población general— puede agravarse (Mittelstadt et al., 2016).
La cuarta es el sesgo de automatización: la tendencia humana a confiar en exceso en las recomendaciones de un sistema automatizado, lo que conduce tanto a errores de omisión (no detectar un problema porque el sistema no lo señala) como de comisión (seguir una recomendación errónea). Una revisión sistemática de Goddard et al. (2012) mostró que este sesgo es frecuente en los sistemas de apoyo a la decisión clínica y que factores como la carga de trabajo, la complejidad de la tarea o la confianza en el sistema lo modulan. En la pericia, este sesgo puede transformar una herramienta de apoyo en un sustituto encubierto del juicio profesional, con el perito limitándose a firmar lo que el sistema ha producido.
4. La inteligencia artificial en las distintas áreas de la medicina legal
Las revisiones disponibles coinciden en que las aplicaciones de IA en las ciencias forenses se han multiplicado, pero también en que la mayoría se encuentran todavía en fase experimental. Galante et al. (2023) identificaron aplicaciones prometedoras en la estimación de la edad, la identificación, la determinación del intervalo postmortem y el análisis de imagen, junto con limitaciones relacionadas con el tamaño de las muestras, la ausencia de validación externa y los problemas de interpretabilidad. Piraianu et al. (2023) llegaron a conclusiones similares, subrayando el potencial de la IA para reforzar la objetividad de la prueba. La revisión de alcance de Tournois et al. (2024), centrada específicamente en la práctica de la medicina forense, encontró que la totalidad de los estudios analizados se situaban aún en el nivel de investigación, sin implantación rutinaria en la práctica pericial. Con este telón de fondo, conviene examinar las distintas áreas por separado.
4.1. Patología forense, tanatología e imagen postmortem
La patología forense ha experimentado en las últimas dos décadas una transformación tecnológica de gran calado con la incorporación de la imagen postmortem. El proyecto Virtopsy, desarrollado en Suiza, demostró la viabilidad de la autopsia virtual mediante tomografía computarizada multicorte y resonancia magnética postmortem como complemento —y en ocasiones alternativa parcial— a la autopsia convencional (Thali et al., 2003). La generalización de estas técnicas genera volúmenes de imágenes que se prestan de forma natural al análisis automatizado.
Dobay et al. (2020) exploraron el uso de técnicas de aprendizaje profundo sobre imagen postmortem y concluyeron que su potencial es considerable, aunque limitado por la escasez de conjuntos de datos forenses etiquetados y por las particularidades de los cambios postmortem, que no se encuentran en la imagen clínica con la que se entrenan la mayoría de los modelos. Garland et al. (2020) evaluaron la capacidad de una red neuronal convolucional para identificar lesiones craneales mortales en tomografías postmortem en un estudio de viabilidad que arrojó resultados prometedores, pero con muestras reducidas y un rendimiento todavía lejos del exigible para su uso pericial autónomo.
En la práctica pericial, el papel previsible de estas herramientas es el de cribado y priorización: señalar fracturas, colecciones hemáticas, gas intravascular o cuerpos extraños que el patólogo debe confirmar, y orientar la autopsia convencional hacia las regiones de interés. Su incorporación podría mejorar la exhaustividad del examen y reducir omisiones, pero la determinación de la causa, el mecanismo y la etiología médico-legal de la muerte —que requiere integrar hallazgos de autopsia, histopatología, toxicología, circunstancias del levantamiento e información policial— sigue siendo un juicio de síntesis que excede con mucho las capacidades de un clasificador de imágenes.
La estimación del intervalo postmortem, uno de los problemas clásicos de la tanatología, constituye otro campo de aplicación. Las aproximaciones tradicionales basadas en fenómenos cadavéricos son notoriamente imprecisas cuando aumenta el tiempo transcurrido. El aprendizaje automático aplicado a datos metabolómicos de distintos tejidos ha mostrado resultados alentadores en estudios recientes (AlJuhani et al., 2025), al igual que el análisis de la sucesión del microbioma postmortem mediante metagenómica combinada con algoritmos de IA (He et al., 2022). Sin embargo, la heterogeneidad de las condiciones ambientales y la falta de validación en casuística real siguen limitando su traslación a la pericia.
4.2. Toxicología forense
La toxicología forense se basa en técnicas analíticas que generan grandes volúmenes de datos espectrométricos, terreno natural para el aprendizaje automático. Ward et al. (2024), en el contexto del sistema sueco de medicina legal y toxicología, propusieron la metabolómica postmortem como herramienta de cribado de alto rendimiento para orientar la causa de la muerte, un enfoque que se apoya en técnicas computacionales de análisis multivariante. Las aplicaciones previsibles incluyen la identificación de nuevas sustancias psicoactivas a partir de su perfil espectral, la detección de patrones metabólicos asociados a determinadas causas de muerte y la interpretación de concentraciones teniendo en cuenta la redistribución postmortem.
Sin embargo, la toxicología forense ilustra bien un principio general: la IA puede refinar la fase analítica, pero la interpretación médico-legal —si una concentración determinada fue causa, concausa o hallazgo incidental en una muerte concreta, a la luz de la tolerancia, las interacciones y las circunstancias— sigue exigiendo un juicio experto contextualizado.
4.3. Clínica médico-forense, lesiones y valoración del daño corporal
La clínica médico-forense —el reconocimiento de personas vivas lesionadas, la valoración de su sanidad y de sus secuelas— constituye el grueso de la actividad cotidiana de muchos institutos de medicina legal. En España, la valoración del daño corporal derivado de accidentes de circulación se rige por un sistema legal de baremación (Ley 35/2015), que exige al perito identificar lesiones, establecer el nexo causal, fijar los periodos de perjuicio temporal y valorar las secuelas conforme a tablas normativas.
En este ámbito, la IA ofrece dos líneas de aplicación diferenciadas. La primera es el análisis de imagen de lesiones. Oura et al. (2021) presentaron una prueba de concepto de interpretación de heridas por arma de fuego mediante aprendizaje profundo, mostrando que es técnicamente posible clasificar automáticamente características relevantes de estas lesiones a partir de fotografías. La segunda línea, más próxima a la práctica habitual, es el uso de LLM para redactar informes de lesiones. Aydogan et al. (2025) evaluaron la capacidad de ChatGPT-4 para generar informes médico-forenses sobre la gravedad de lesiones en el marco del sistema legal turco, a partir de 366 casos. El modelo alcanzó una concordancia elevada —en torno al 96 %—, pero inferior a la de los médicos asistentes humanos (en torno al 99 %), y los autores concluyeron que su uso exige supervisión especializada. Una diferencia de tres puntos porcentuales puede parecer pequeña, pero en un volumen de miles de informes anuales significa decenas de calificaciones erróneas con repercusión directa en la tipificación penal de los hechos.
La valoración del daño corporal es, además, un terreno en el que la entrevista y la exploración física no son reemplazables: la comprobación de balances articulares, la exploración neurológica, la valoración de la coherencia entre síntomas referidos y hallazgos objetivos o la detección de la exageración sintomática requieren la presencia del perito ante el lesionado. La IA puede ayudar a ordenar la documentación clínica, a calcular la indemnización conforme al baremo o a detectar inconsistencias documentales, pero no puede explorar.
4.4. Antropología y odontología forense: la estimación de la edad
La estimación de la edad de personas vivas tiene una enorme trascendencia jurídica, en particular cuando debe determinarse si una persona es mayor o menor de edad en ausencia de documentación fiable. Los métodos clásicos, basados en la comparación de radiografías con atlas de referencia, son criticados por su variabilidad entre observadores y su dependencia de poblaciones de referencia que no siempre se corresponden con la evaluada.
La estimación automática de la edad es uno de los campos más maduros de la IA forense. Štern et al. (2019) desarrollaron un sistema de estimación automática de la edad y de clasificación de la mayoría de edad a partir de resonancias magnéticas de múltiples regiones anatómicas (mano, clavícula y dientes), una aproximación que además evita la radiación ionizante. En el ámbito dental, Vila-Blanco et al. (2020), un grupo español, propusieron redes neuronales profundas para la estimación de la edad cronológica a partir de ortopantomografías, con errores medios reducidos en menores de 15 años. Park et al. (2024), con más de 13.000 radiografías panorámicas de población surcoreana, obtuvieron una precisión muy elevada en la estimación del sexo y un error medio de algo menos de tres años en la estimación de la edad.
Estos resultados son relevantes, pero también ilustran los límites de la automatización pericial. El margen de error, aun reducido, sigue siendo significativo precisamente en la franja de edad más relevante jurídicamente (en torno a los 18 años), y los modelos entrenados en una población concreta pueden no ser trasladables a personas de otros orígenes geográficos, socioeconómicos o nutricionales. El informe pericial de edad debe expresar la incertidumbre, valorar críticamente la aplicabilidad del método a la persona examinada y, en caso de duda, aplicar el principio favorable a la minoría de edad. Ninguna de estas operaciones es puramente técnica.
4.5. Genética forense
La genética forense es un ejemplo paradigmático de disciplina en la que la automatización ya es una realidad, mediante programas de genotipado probabilístico que interpretan mezclas complejas de ADN y calculan razones de verosimilitud. Este campo ilustra tanto las ventajas como los riesgos de la automatización. Por un lado, los sistemas probabilísticos ofrecen una consistencia que los analistas humanos no siempre alcanzan, como demostraron los resultados divergentes documentados por Dror y Hampikian (2011). Por otro, su funcionamiento interno es difícil de auditar para la defensa, y el resultado depende de supuestos y parámetros introducidos por el analista. La experiencia acumulada en genética forense sugiere que la automatización no elimina el juicio experto, sino que lo desplaza a la elección del modelo, los parámetros y la comunicación del resultado al tribunal.
4.6. Responsabilidad profesional sanitaria
Los informes periciales sobre responsabilidad profesional médica son, quizá, los más complejos desde el punto de vista argumentativo. Exigen reconstruir la secuencia asistencial a partir de la historia clínica, identificar el estándar de cuidado exigible en el momento y lugar de los hechos (la lex artis ad hoc), valorar si la actuación se ajustó a él, establecer el nexo causal entre una eventual desviación y el daño, y cuantificar ese daño. Es un terreno en el que los LLM podrían parecer especialmente útiles, por su capacidad para procesar grandes volúmenes de documentación.
El estudio de Bérar et al. (2026) constituye la evaluación empírica más directa disponible sobre esta cuestión. Los autores sometieron a varios modelos de lenguaje (ChatGPT-4 Turbo, Gemini y Mistral) a nueve casos ficticios de responsabilidad médica y compararon sus respuestas con las de un panel de peritos forenses. Los modelos coincidieron con los expertos en aproximadamente dos tercios de las consultas, pero omitieron errores evidentes, señalaron faltas inexistentes e incurrieron en contradicciones internas. Los autores concluyeron que las conclusiones finales deben permanecer en manos de peritos con formación médico-legal.
A ello se añade una cuestión de responsabilidad: si el perito médico utiliza una herramienta de IA y esta induce a error, la responsabilidad no se desplaza al fabricante de la herramienta. La doctrina norteamericana ha señalado que, en el estado actual del derecho, el médico que sigue una recomendación de IA que se aparta del estándar de cuidado asume el riesgo de responsabilidad, lo que incentiva usar la IA únicamente como confirmación de la práctica estándar (Price et al., 2019). El razonamiento es trasladable, con mayor razón, al perito, cuyo deber de objetividad y diligencia es personal (Gerke et al., 2020).
4.7. Las especialidades clínicas como fuente de prueba
Una parte considerable de la prueba pericial médica no la emiten médicos forenses, sino especialistas clínicos —radiólogos, traumatólogos, neurólogos, oftalmólogos, cardiólogos— que actúan como peritos de parte o designados judicialmente. En estas especialidades, la IA ya forma parte, en ocasiones, del propio acto asistencial: sistemas de detección de nódulos o fracturas en radiología, análisis automatizado de electrocardiogramas o de retinografías, clasificación de lesiones cutáneas (Esteva et al., 2017). De ello se deriva una consecuencia procesal relevante: el perito puede verse obligado a valorar no solo la actuación del médico, sino también la de la herramienta de IA que este utilizó, y si era razonable confiar en ella. La pericia sobre la IA —su validación, su uso conforme a las instrucciones del fabricante, la adecuación de la supervisión humana— se perfila como un nuevo campo de la medicina legal.
4.8. Balance de las aplicaciones en medicina legal
La revisión anterior permite extraer algunas conclusiones generales. Primero, la IA ofrece su mayor rendimiento en tareas perceptivas y analíticas bien acotadas (análisis de imagen, procesamiento de datos analíticos, estimación de parámetros cuantitativos) y en tareas de organización documental. Segundo, su rendimiento es muy inferior en las tareas de integración e interpretación que constituyen el núcleo del juicio médico-legal. De Boer et al. (2026), al someter a ChatGPT a un examen simulado de especialidad en patología forense evaluado de forma ciega, constataron un buen desempeño en preguntas de conocimiento factual, pero un rendimiento deficiente en razonamiento complejo, interpretación de imágenes y análisis de casos de autopsia; y, lo que resulta especialmente preocupante, comprobaron que la fluidez y capacidad persuasiva de las respuestas enmascaraba esos errores. Tercero, prácticamente ninguna aplicación ha alcanzado el nivel de validación externa que permitiría utilizarla de forma rutinaria como fundamento autónomo de una conclusión pericial (Tournois et al., 2024). Como han señalado Dinis-Oliveira y Azevedo (2023), herramientas como ChatGPT abren en las ciencias forenses una auténtica «caja de Pandora»: útiles para tareas auxiliares como la revisión bibliográfica o la redacción, pero cuyo producto debe ser siempre verificado por expertos certificados antes de llegar a un tribunal.
5. La psiquiatría forense ante la inteligencia artificial
5.1. La especificidad epistemológica de la pericia psiquiátrica
La psiquiatría forense ocupa una posición singular dentro de la medicina legal. Mientras que la mayoría de las pericias médicas pueden apoyarse en hallazgos objetivos —una fractura, una concentración de tóxico, una lesión anatómica—, la pericia psiquiátrica descansa en gran medida en la exploración del estado mental a través de la entrevista, en la observación de la conducta y en la reconstrucción de la biografía y de la psicopatología del sujeto. No existen, en la actualidad, biomarcadores validados que permitan diagnosticar con fiabilidad los trastornos mentales en el caso individual, y menos aún que permitan responder a las preguntas jurídicas que se formulan al perito.
Esas preguntas, además, no son clínicas sino psicolegales. No se pide al psiquiatra forense que diagnostique, sino que valore si, en el momento de los hechos, una persona podía comprender la ilicitud de su conducta o actuar conforme a esa comprensión (art. 20.1 del Código Penal); si precisa apoyos para el ejercicio de su capacidad jurídica; si existe un pronóstico de comportamiento futuro que revele la probabilidad de comisión de nuevos delitos, presupuesto de las medidas de seguridad (art. 95 del Código Penal; Ley Orgánica 10/1995); si es capaz de comparecer el juicio en el que está como acusado; o si los síntomas que refiere son genuinos o simulados. Cada una de estas valoraciones exige un salto inferencial desde lo clínico hasta lo normativo que no es reducible a un cálculo.
A ello se suma la dimensión relacional. La entrevista psiquiátrica forense se desarrolla en un contexto no terapéutico, con un examinado que puede tener poderosos incentivos para ocultar, exagerar o fabricar síntomas, y en el que el perito debe manejar la tensión entre la empatía necesaria para obtener información y la distancia necesaria para valorarla críticamente. Estas características hacen de la psiquiatría forense un banco de pruebas especialmente exigente para cualquier pretensión de automatización.
5.2. Diagnóstico y evaluación clínica asistidos por IA
La investigación sobre IA en psiquiatría ha crecido de forma notable. Las revisiones de referencia subrayan la promesa del aprendizaje automático para predecir la respuesta al tratamiento o el curso clínico, pero también la distancia que separa los resultados de los estudios de su aplicación en la práctica real, debido a problemas de tamaño muestral, sobreajuste, validación externa insuficiente e implementación (Chekroud et al., 2021; Koutsouleris et al., 2022).
Los LLM han añadido una dimensión nueva. Kim et al. (2024) observaron que varios modelos de lenguaje identificaban el trastorno obsesivo-compulsivo a partir de viñetas clínicas con una precisión superior a la de profesionales de la salud mental y de atención primaria. Galatzer-Levy et al. (2023) mostraron que un modelo médico de lenguaje podía estimar puntuaciones de escalas psiquiátricas a partir de entrevistas y relatos clínicos con un rendimiento apreciable. Levkovich y Elyoseph (2023), en cambio, encontraron que las valoraciones del riesgo suicida realizadas por distintas versiones de ChatGPT diferían de forma relevante: la versión más antigua tendía a infravalorar el riesgo en los casos más graves, mientras que la más reciente se aproximaba a la valoración de los profesionales, aunque sobrestimaba el peso de determinados factores. La lección es doble: el rendimiento de estos sistemas puede ser alto en condiciones controladas, pero es inestable, depende de la versión del modelo y se ha medido casi siempre con viñetas escritas, no con personas reales en contextos adversariales.
Este último matiz es crucial para la pericia. Una viñeta clínica es un texto ya elaborado por un clínico, que ha seleccionado y organizado la información relevante. En la pericia psiquiátrica real, esa selección y organización es precisamente lo que el perito debe hacer, a partir de un relato fragmentario, contradictorio y, a menudo, interesado.
5.3. Análisis automatizado del lenguaje y fenotipado digital
Una línea de investigación particularmente interesante para la psiquiatría forense es el análisis computacional del lenguaje. Bedi et al. (2015) mostraron que el análisis automatizado de la coherencia semántica y la complejidad sintáctica del habla libre permitía predecir la transición a la psicosis en jóvenes de alto riesgo, en una muestra pequeña. Corcoran et al. (2018) replicaron y extendieron estos hallazgos en distintas cohortes y protocolos. Estas técnicas podrían, en el futuro, aportar indicadores objetivos de alteraciones formales del pensamiento que complementen la exploración clínica.
Su trasposición al ámbito forense plantea, sin embargo, problemas considerables. Las alteraciones del lenguaje pueden deberse a factores culturales, educativos, lingüísticos o neurológicos ajenos al trastorno mental; los modelos se han entrenado mayoritariamente en lengua inglesa y en poblaciones clínicas concretas; y la pregunta forense no es si existe un trastorno del pensamiento en el momento de la evaluación, sino si existía en el momento de los hechos y qué influencia tuvo sobre la conducta. Por otra parte, el Reglamento europeo de inteligencia artificial prohíbe, con excepciones, los sistemas de reconocimiento de emociones en el lugar de trabajo y en centros educativos y clasifica como de alto riesgo diversos usos de sistemas biométricos y de reconocimiento de emociones (Reglamento [UE] 2024/1689), lo que anticipa un escrutinio regulatorio intenso sobre cualquier herramienta que pretenda inferir estados mentales a partir de señales conductuales.
5.4. Valoración del riesgo de violencia y peligrosidad
La valoración del riesgo de violencia es, probablemente, el ámbito de la psiquiatría forense en el que los instrumentos actuariales y algorítmicos tienen una trayectoria más larga. Mucho antes de la popularización de la IA, la psiquiatría y la psicología forenses desarrollaron escalas estructuradas para estimar la probabilidad de reincidencia. La evidencia acumulada sobre ellas es instructiva. El metaanálisis de Fazel et al. (2012), con 73 muestras y casi 25.000 personas, concluyó que estos instrumentos tienen una capacidad predictiva moderada: son razonablemente útiles para identificar a las personas de bajo riesgo, pero su valor predictivo positivo es limitado, de modo que una proporción importante de las personas clasificadas como de alto riesgo no llega a reincidir. Una revisión sistemática posterior sobre instrumentos empleados en la fase de sentencia encontró que la calidad de los estudios de validación era generalmente baja y que el rendimiento predictivo variaba considerablemente (Fazel et al., 2022).
La sofisticación algorítmica no parece resolver estos límites. Dressel y Farid (2018) demostraron que el sistema comercial COMPAS, utilizado en tribunales estadounidenses para predecir la reincidencia, no era más preciso que las predicciones de personas sin formación específica reclutadas en línea, y que un modelo lineal con solo dos variables (edad y número de condenas previas) alcanzaba un rendimiento equivalente. Este hallazgo sugiere que existe un techo en la predictibilidad de la conducta humana individual que no depende tanto de la potencia del algoritmo como de la naturaleza del fenómeno.
Desde el punto de vista ético, se ha argumentado que el uso de instrumentos de riesgo en la justicia penal y en la psiquiatría forense exige datos de mucha mejor calidad sobre su rendimiento en las poblaciones concretas a las que se aplican (Douglas et al., 2017), y que la incorporación de IA a la valoración del riesgo de violencia debe examinarse a la luz de los principios de autonomía, beneficencia, no maleficencia y justicia, con especial atención al riesgo de discriminación (Cockerill, 2020). El Reglamento europeo de IA ha ido más allá: prohíbe los sistemas de IA destinados a evaluar o predecir el riesgo de que una persona física cometa un delito basándose únicamente en la elaboración de perfiles o en la evaluación de rasgos y características de su personalidad, si bien excluye de la prohibición los sistemas que apoyan la valoración humana de la implicación de una persona en una actividad delictiva basada en hechos objetivos y verificables (art. 5.1.d del Reglamento [UE] 2024/1689). La frontera entre un instrumento de apoyo a la valoración pericial y un sistema predictivo prohibido será, previsiblemente, objeto de debate doctrinal y jurisprudencial.
5.5. Detección de la simulación: la IA como herramienta y como amenaza
La detección de la simulación es una tarea central de la psiquiatría forense, especialmente en contextos de incapacidad laboral, reclamaciones de daños psíquicos y alegaciones de inimputabilidad. La investigación ha explorado el uso del aprendizaje automático para identificar patrones de respuesta característicos de la simulación. Monaro et al. (2018) desarrollaron una herramienta basada en el análisis de la dinámica de respuesta del examinado ante preguntas sobre síntomas depresivos que, en condiciones experimentales, discriminaba con alta precisión entre síntomas genuinos y simulados. Orrù et al. (2020) han defendido de forma más general la utilidad del aprendizaje automático en psicometría para construir modelos predictivos más robustos que los análisis estadísticos tradicionales.
Pero la IA es también una amenaza para la detección de la simulación. Gershan et al. (2025) analizaron las respuestas de ChatGPT a preguntas sobre síntomas psicóticos, simulación y defensa por enajenación: aunque la mayoría de las respuestas eran correctas, el sistema proporcionó orientaciones prácticas que podrían ayudar a fingir una enfermedad mental. Fuermaier y Niesten (2025), en un estudio experimental con 110 estudiantes, demostraron que el entrenamiento con materiales generados por ChatGPT permitía simular un trastorno por déficit de atención con hiperactividad de forma más convincente y con menor probabilidad de ser detectado por las pruebas neuropsicológicas de validez. Roof (2025) ha advertido de que este «engaño asistido por IA» constituye un desafío emergente para la psiquiatría forense que exige actualizar tanto los instrumentos de evaluación como la formación de los peritos.
Esta doble dimensión ilustra una idea central de este ensayo: la IA no solo cambia las herramientas del perito, sino también el entorno en el que trabaja. Los examinados, los abogados y las partes tendrán acceso a las mismas herramientas, y el perito deberá tenerlo en cuenta.
5.6. Los modelos de lenguaje en la elaboración y el análisis del informe psiquiátrico
El uso de LLM para analizar o redactar informes psiquiátricos forenses es todavía incipiente. Petroni et al. (2025) presentaron un estudio de caso en el que GPT-4o se utilizó para extraer variables clínicas y no clínicas de informes periciales italianos sobre imputabilidad y peligrosidad social y para generar resúmenes de su contenido. El trabajo, basado en un número muy reducido de informes, sugiere que estas herramientas podrían semiautomatizar la recogida de datos con fines de investigación, pero no aporta evidencia sobre su capacidad para emitir valoraciones periciales.
En el plano conceptual, Grabb y Angelotta (2023) han señalado que la entrada de los LLM en la práctica forense plantea problemas de fiabilidad, sesgo, validez externa y responsabilidad que la psiquiatría forense debe abordar antes de su adopción. Tortora (2024) ha analizado las aplicaciones de la IA generativa en psiquiatría forense, reconociendo su potencial en la valoración del riesgo y en la formación mediante simulaciones, pero advirtiendo de que agrava problemas ya conocidos —sesgo, opacidad, privacidad— y añade otros nuevos, como las alucinaciones y la posibilidad de pruebas falsificadas mediante deepfakes.
En la práctica, las tareas en las que un LLM puede aportar valor real en la pericia psiquiátrica son de carácter instrumental: transcribir y estructurar entrevistas grabadas con consentimiento, ordenar cronológicamente la historia clínica y los antecedentes, identificar contradicciones entre distintas fuentes documentales, verificar que el informe aborda todas las cuestiones planteadas por el tribunal, o mejorar la claridad expositiva del texto. En cambio, la valoración de la credibilidad, la formulación diagnóstica en un contexto adversarial y, sobre todo, la traducción de la psicopatología a las categorías jurídicas son tareas que exigen un juicio clínico y ético que estos sistemas no pueden asumir con garantías.
5.7. Neuropredicción y neuroderecho
Una última línea de reflexión se refiere a la combinación de neuroimagen e IA con fines predictivos o explicativos en el ámbito penal. Tortora et al. (2020) han examinado, desde la perspectiva del neuroderecho, la posibilidad de emplear técnicas de neuroimagen analizadas mediante IA para predecir la reincidencia o para fundamentar valoraciones de imputabilidad. Sus conclusiones son prudentes: aunque la neuropredicción podría mejorar en el futuro la precisión de algunas valoraciones, plantea problemas graves de validez en el caso individual, de privacidad mental y de compatibilidad con los principios del derecho penal, como la culpabilidad y la presunción de inocencia. El riesgo de que una imagen cerebral procesada por un algoritmo adquiera ante el tribunal un poder persuasivo desproporcionado a su valor científico real es considerable.
6. ¿Un informe pericial íntegramente elaborado por inteligencia artificial?
6.1. Planteamiento: grados de automatización
La pregunta de si un sistema de IA podría elaborar un informe pericial médico completo, sin intervención humana, no admite una respuesta binaria. Resulta útil distinguir distintos grados de automatización, inspirados en las taxonomías empleadas en otros sectores, como la conducción autónoma. La tabla siguiente propone una clasificación orientativa aplicada a la pericia médica.
Nivel | Denominación | Papel de la IA | Papel del perito humano | Situación actual |
0 | Pericia convencional | Ninguno o herramientas informáticas generales | Realiza todas las fases | Práctica tradicional |
1 | Asistencia documental | Búsqueda bibliográfica, transcripción, ordenación de documentos, corrección de estilo | Realiza la exploración, el análisis y las conclusiones | Ya extendido, a menudo sin declarar |
2 | Asistencia analítica | Análisis de imagen, datos analíticos o escalas; sugiere hallazgos | Valida los hallazgos y elabora las conclusiones | En investigación; uso puntual |
3 | Borrador integral supervisado | Genera un borrador completo de informe a partir de la documentación | Revisa, corrige, asume y firma el informe | Técnicamente posible; riesgos elevados |
4 | Informe autónomo con firma nominal | Elabora el informe; el humano firma sin revisión sustantiva | Responsable formal, no real | Inaceptable jurídica y deontológicamente |
5 | Informe autónomo sin perito | Elabora, emite y «defiende» el informe | Inexistente | Jurídicamente imposible en el marco vigente |
Tabla 1. Grados de automatización en la elaboración del informe pericial médico.
Los niveles 1 y 2 son ya una realidad o lo serán próximamente, y no plantean objeciones de principio siempre que se respeten determinadas garantías. El nivel 3 constituye la frontera crítica: es técnicamente viable con los LLM actuales y puede resultar tentador por razones de eficiencia, pero desliza peligrosamente hacia el nivel 4, en el que la supervisión humana se convierte en una formalidad. Los niveles 4 y 5 corresponden a lo que, en sentido estricto, cabría denominar un informe pericial elaborado íntegramente por IA. A continuación se examinan los obstáculos jurídicos, epistémicos y éticos que se oponen a esta hipótesis.
6.2. Obstáculos jurídicos
El primer obstáculo es de naturaleza subjetiva. El ordenamiento procesal español concibe al perito como una persona física dotada de una titulación oficial (art. 340.1 LEC; art. 457 LECrim) que presta juramento o promesa de actuar con objetividad (art. 335.2 LEC). Un sistema de IA no puede ostentar un título, ni prestar juramento, ni asumir un compromiso personal de veracidad. Tampoco puede ser objeto de recusación o tacha por las causas que la ley prevé, que presuponen relaciones personales, intereses o vínculos con las partes.
El segundo obstáculo es procesal. Los principios de inmediación, oralidad y contradicción exigen que el perito pueda comparecer en el acto del juicio para explicar su dictamen, responder a las preguntas de las partes y del tribunal y, en su caso, someterse a careo con otros peritos (art. 347 LEC). Aunque podría imaginarse un sistema capaz de responder por escrito o mediante voz sintética a las preguntas formuladas, ello no satisfaría la exigencia de contradicción en su sentido material: la posibilidad de poner a prueba la competencia, la coherencia y la honestidad de quien sostiene una opinión experta. Un sistema que puede producir respuestas distintas ante la misma pregunta, o que no puede explicar verazmente por qué alcanzó una conclusión, no puede ser contradicho en un sentido jurídicamente significativo.
El tercer obstáculo es la responsabilidad. El perito responde civil, disciplinaria y penalmente de su dictamen; el Código Penal castiga al perito que falta maliciosamente a la verdad (art. 459 del Código Penal). Un sistema de IA no es sujeto de responsabilidad, y la eventual responsabilidad del fabricante, del proveedor o de quien lo utiliza se rige por regímenes diferentes que no garantizan la misma función de aseguramiento de la veracidad. La literatura sobre responsabilidad en la IA sanitaria ha subrayado precisamente la indefinición de los regímenes de responsabilidad cuando intervienen sistemas automatizados (Gerke et al., 2020; Price et al., 2019).
El cuarto obstáculo es regulatorio. El Reglamento europeo de inteligencia artificial establece un régimen específico para los sistemas de alto riesgo, entre los que incluye los destinados a ser utilizados por una autoridad judicial, o en su nombre, para ayudarla en la investigación e interpretación de hechos y del derecho y en la aplicación de la ley a un conjunto concreto de hechos (anexo III, punto 8, del Reglamento [UE] 2024/1689), así como determinados sistemas utilizados por autoridades encargadas de la aplicación de la ley, por ejemplo para evaluar la fiabilidad de las pruebas (anexo III, punto 6). Además, muchos sistemas de IA de uso médico se consideran de alto riesgo por su condición de productos sanitarios. Para estos sistemas, el Reglamento exige que estén diseñados de modo que puedan ser vigilados efectivamente por personas físicas durante su uso, con el fin de prevenir o reducir al mínimo los riesgos para la salud, la seguridad o los derechos fundamentales, y que esas personas sean conscientes de la posible tendencia a confiar automáticamente o en exceso en los resultados del sistema (art. 14). Es decir, la propia norma europea incorpora expresamente la preocupación por el sesgo de automatización y presupone la supervisión humana. Debe advertirse que el calendario de aplicación de algunas obligaciones relativas a sistemas de alto riesgo ha sido objeto de propuestas de ajuste, por lo que su exigibilidad concreta debe comprobarse en cada momento; la orientación de fondo, sin embargo, es inequívoca.
En el ámbito interno, el Real Decreto-ley 6/2023 ha regulado por primera vez en España las actuaciones judiciales automatizadas, proactivas y asistidas, y ha establecido que los borradores de texto generados mediante sistemas de apoyo no constituyen resolución sin la intervención y validación de la autoridad competente. Aunque esta norma se refiere a la actuación de los órganos judiciales y no a la prueba pericial, expresa un principio de política legislativa —la IA asiste, pero no sustituye a quien tiene la función atribuida— que resulta plenamente trasladable a la pericia.
El quinto obstáculo se refiere a la protección de datos. Los informes periciales médicos tratan datos de salud, categoría especial de datos personales sometida a un régimen reforzado (art. 9 del Reglamento [UE] 2016/679). El mismo Reglamento reconoce el derecho de toda persona a no ser objeto de una decisión basada únicamente en el tratamiento automatizado que produzca efectos jurídicos en ella o la afecte significativamente de modo similar (art. 22). Aunque el informe pericial no es en sí mismo una decisión, su influencia sobre la decisión judicial puede ser determinante, lo que aconseja una interpretación prudente. Por otra parte, el uso de servicios comerciales de IA generativa para procesar documentación clínica implica comunicar datos de salud a terceros, a menudo con servidores fuera del Espacio Económico Europeo, lo que plantea problemas de licitud, de confidencialidad y de secreto profesional que el perito no puede ignorar.
6.3. Obstáculos epistémicos: lo que dice la evidencia
Aun si los obstáculos jurídicos pudieran superarse mediante reformas legislativas, subsistiría la cuestión de si la IA es capaz de producir informes periciales de calidad comparable a los humanos. La evidencia disponible, todavía escasa, apunta claramente en sentido negativo.
Los estudios que han evaluado directamente el desempeño de los LLM en tareas periciales muestran un patrón consistente: rendimiento aceptable o bueno en tareas factuales o de clasificación simple, y rendimiento insuficiente en las tareas que requieren integración, razonamiento causal y juicio contextual. Así ocurre en la calificación de lesiones, donde el modelo se aproxima pero no alcanza la precisión humana (Aydogan et al., 2025); en la patología forense, donde las deficiencias en razonamiento complejo quedan ocultas tras respuestas fluidas y persuasivas (de Boer et al., 2026); y en la responsabilidad profesional médica, donde los modelos omiten errores evidentes, señalan faltas inexistentes y se contradicen (Bérar et al., 2026). En psiquiatría, la evidencia procede casi exclusivamente de viñetas y no se ha evaluado el rendimiento en informes reales sobre imputabilidad o capacidad (Kim et al., 2024; Levkovich y Elyoseph, 2023; Petroni et al., 2025).
Un problema adicional es que los LLM no tienen acceso directo a la realidad que debe peritarse. Trabajan sobre documentos y relatos; no exploran, no observan, no palpan, no escuchan la prosodia de un discurso ni perciben la incongruencia afectiva de un examinado. En medicina legal, la exploración directa no es un elemento accesorio, sino la fuente primaria de los datos sobre los que se construye la pericia. Un informe íntegramente elaborado por IA sería, en el mejor de los casos, un informe documental, con las limitaciones que la doctrina médico-legal reconoce a este tipo de pericias.
Por último, las alucinaciones plantean un problema de fiabilidad que no es marginal. Un sistema que genera con cierta frecuencia datos, referencias o hechos falsos con la misma apariencia de certeza que los verdaderos (Alkaissi y McFarlane, 2023; Walters y Wilder, 2023) no puede ser fuente autónoma de una prueba destinada a fundamentar resoluciones judiciales. El caso Mata v. Avianca, Inc. (2023) es una advertencia de lo que puede ocurrir cuando un profesional delega en un LLM sin verificar su producto.
6.4. Obstáculos éticos y de legitimidad
Más allá de lo jurídico y lo epistémico, la hipótesis del informe pericial automatizado plantea cuestiones de legitimidad. Los marcos éticos de referencia para la IA coinciden en exigir que los sistemas respeten la autonomía humana, eviten daños, sean justos y resulten explicables, y que exista siempre una atribución clara de responsabilidad (Floridi et al., 2018; Mittelstadt et al., 2016). En medicina, se ha advertido del riesgo de que los sistemas de aprendizaje automático incorporen los valores y los incentivos de quienes los diseñan y financian, y de que su uso altere la relación de confianza entre profesional y paciente (Char et al., 2018).
En la pericia, esta advertencia cobra un sentido particular. El informe pericial no es solo un producto técnico, sino un acto de comunicación entre la medicina y la justicia, mediado por una persona que asume, ante el tribunal y ante la sociedad, la responsabilidad de lo que afirma. La persona examinada —el lesionado, el investigado, la persona cuya capacidad se evalúa— tiene derecho a ser examinada por alguien que pueda escucharla, comprender su situación y responder de lo que diga sobre ella. Reducir ese acto a un procesamiento algorítmico supondría, además de un riesgo para la exactitud, una forma de cosificación incompatible con la dignidad de la persona.
6.5. Argumentos a favor y la paradoja del perito automatizado
Sería injusto no considerar los argumentos a favor de una mayor automatización. Los partidarios podrían alegar que la IA no conoce a la parte que paga el informe y, por tanto, eliminaría el sesgo de adscripción documentado por Murrie et al. (2013); que aplicaría criterios de forma consistente, evitando la variabilidad entre peritos; que reduciría los tiempos de espera, endémicos en muchos institutos de medicina legal; y que haría accesible una pericia de calidad a quienes no pueden costear un perito de parte.
Estos argumentos tienen peso, pero deben matizarse. La consistencia de un sistema no equivale a su exactitud: un sistema puede ser consistentemente erróneo, y su error, al ser sistemático, afectaría a todos los casos de forma simultánea. La supuesta neutralidad se desvanece cuando se advierte que el resultado de un LLM depende en gran medida de cómo se formula la pregunta y de qué documentos se le proporcionan, decisiones que seguirían tomando las partes. Y la eficiencia, siendo un valor legítimo, no puede prevalecer sobre las garantías del proceso.
Surge así lo que podría denominarse la paradoja del perito automatizado: cuanto más fiable y autónomo fuera un sistema de IA, más difícil resultaría su control efectivo por el tribunal y por las partes, y más intenso sería el sesgo de automatización de quienes debieran supervisarlo. Un sistema que acierta el 98 % de las veces es más peligroso, en cierto sentido, que uno que acierta el 70 %, porque nadie revisará con atención sus conclusiones. La supervisión humana tiende a degradarse precisamente cuando el sistema funciona bien, y es entonces cuando sus errores pasan inadvertidos.
6.6. La especificidad psiquiátrica: por qué la automatización es aún menos viable
Todo lo anterior es aplicable, con mayor intensidad, a la psiquiatría forense. En primer lugar, porque la fuente principal de información es la entrevista, que es un acto interpersonal en el que el propio perito actúa como instrumento de exploración. En segundo lugar, porque la pregunta psicolegal exige una valoración retrospectiva (el estado mental en el momento de los hechos) o prospectiva (el riesgo futuro) que no puede derivarse directamente de los datos presentes. En tercer lugar, porque la simulación y la disimulación son frecuentes, y la propia IA puede ser utilizada por el examinado para entrenarse (Fuermaier y Niesten, 2025; Gershan et al., 2025). En cuarto lugar, porque la predicción del riesgo de violencia mediante algoritmos ha mostrado límites de rendimiento que no parecen superables mediante mayor potencia computacional (Dressel y Farid, 2018; Fazel et al., 2022) y porque el propio Reglamento europeo prohíbe los sistemas que pretenden predecir la comisión de delitos basándose únicamente en perfiles o rasgos de personalidad. Y, finalmente, porque las consecuencias de la pericia psiquiátrica —la privación de libertad mediante una medida de seguridad, la limitación del ejercicio de la capacidad jurídica, la exoneración o no de responsabilidad penal— afectan a los derechos fundamentales de forma especialmente intensa.
Un informe psiquiátrico forense elaborado íntegramente por IA no sería, en definitiva, un informe psiquiátrico: sería un ejercicio de clasificación documental revestido de una autoridad clínica que no posee.
7. Hacia un modelo de «perito aumentado»: propuestas de buenas prácticas
Rechazar la hipótesis del informe pericial autónomo no significa rechazar la IA. La alternativa razonable es un modelo de «perito aumentado», en el que la IA potencia las capacidades del perito sin sustituir su juicio ni diluir su responsabilidad. A partir del análisis anterior, pueden formularse las siguientes recomendaciones.
Declaración expresa del uso de IA. El informe debe indicar qué herramientas de IA se han utilizado, con qué versión, para qué tareas concretas y bajo qué supervisión. Esta transparencia es condición de la contradicción y debería incorporarse a las guías de buenas prácticas de las sociedades científicas y a los protocolos de los institutos de medicina legal.
Verificación integral. Todo dato, cita bibliográfica, cifra o afirmación procedente de un sistema de IA debe ser verificado en su fuente original por el perito antes de incorporarse al informe. La firma del perito debe implicar que ha comprobado personalmente el contenido.
Preferencia por herramientas validadas e interpretables. En las tareas analíticas deben preferirse sistemas validados externamente en poblaciones comparables a la evaluada, con métricas de error conocidas y, cuando sea posible, interpretables (Rudin, 2019). El perito debe poder explicar al tribunal por qué confió en la herramienta.
Exploración personal irrenunciable. La exploración física y la entrevista clínica, cuando proceden, deben ser realizadas por el perito. La IA puede apoyar el registro y el análisis, pero no sustituir el encuentro con la persona examinada.
Protección de los datos. No deben introducirse datos de salud identificables en servicios de IA de uso general que no ofrezcan garantías adecuadas conforme al Reglamento general de protección de datos. Los institutos de medicina legal y los colegios profesionales deberían facilitar herramientas seguras desplegadas en entornos controlados.
Formación en IA y en sesgo de automatización. La formación de los peritos médicos, y en particular de los especialistas en medicina legal y forense y de los psiquiatras forenses, debe incluir contenidos sobre el funcionamiento, los límites y los riesgos de la IA, así como estrategias para contrarrestar el sesgo de automatización (Goddard et al., 2012).
Actualización de la evaluación de la simulación. Los instrumentos y protocolos de detección de la simulación deben revisarse a la luz de la posibilidad de que los examinados se hayan preparado con ayuda de IA (Roof, 2025).
Separación entre tareas instrumentales y juicio pericial. Las tareas de transcripción, ordenación documental, búsqueda bibliográfica y corrección de estilo pueden delegarse con supervisión; la selección de los datos relevantes, la interpretación y la formulación de las conclusiones médico-legales deben permanecer en manos del perito.
Investigación aplicada en contexto forense. Es necesario promover estudios que evalúen las herramientas de IA en casuística forense real, en lengua española y en poblaciones representativas de las que llegan a los tribunales, con diseños que comparen informes asistidos y no asistidos.
Estas recomendaciones son coherentes con el principio de supervisión humana del Reglamento europeo de IA y con la exigencia constitucional de un proceso con todas las garantías. Su objetivo no es frenar la innovación, sino garantizar que esta refuerce, y no erosione, la calidad y la legitimidad de la prueba pericial.
8. Conclusiones
Primera. La inteligencia artificial está llamada a transformar la práctica de la medicina legal y forense. Sus aplicaciones más maduras se concentran en tareas perceptivas y analíticas acotadas —análisis de imagen postmortem, estimación de la edad, procesamiento de datos analíticos— y en la gestión documental. La evidencia disponible, sin embargo, sitúa la mayoría de estas aplicaciones en fase de investigación, sin validación suficiente para su uso rutinario como fundamento autónomo de conclusiones periciales.
Segunda. Los modelos de lenguaje de gran tamaño ofrecen ventajas evidentes en la síntesis de documentación y la redacción, pero presentan limitaciones estructurales —alucinaciones, opacidad, inestabilidad entre versiones, sesgos— que los hacen inadecuados como autores de informes periciales. Los estudios que han evaluado su desempeño en tareas médico-legales muestran un buen rendimiento en cuestiones factuales y deficiencias relevantes en razonamiento complejo, a menudo enmascaradas por la fluidez de sus respuestas.
Tercera. La psiquiatría forense es el ámbito en el que la automatización resulta menos viable, por la centralidad de la entrevista, la naturaleza psicolegal de las preguntas, la frecuencia de la simulación —que la propia IA puede facilitar— y la intensidad de la afectación de derechos fundamentales. La experiencia con los instrumentos algorítmicos de valoración del riesgo muestra que existen límites a la predictibilidad de la conducta individual que la potencia computacional no supera.
Cuarta. Un informe pericial médico elaborado íntegramente por IA, sin intervención humana, es en la actualidad jurídicamente inviable en el ordenamiento español y europeo: el perito ha de ser una persona física cualificada, que presta juramento, responde de su dictamen y se somete a contradicción; y el Reglamento europeo de inteligencia artificial exige supervisión humana efectiva en los sistemas de alto riesgo. Es, además, epistémicamente prematuro y éticamente desaconsejable.
Quinta. El modelo deseable es el del «perito aumentado»: un profesional que utiliza la IA de forma declarada, verificada y supervisada para mejorar la exhaustividad, la consistencia y la eficiencia de su trabajo, pero que conserva íntegramente el juicio, la exploración y la responsabilidad. La IA puede ayudar a mitigar algunos sesgos humanos bien documentados, pero solo si el perito es consciente de los nuevos sesgos que introduce, empezando por el de automatización.
Sexta. La medicina legal tiene ante sí una doble tarea: incorporar críticamente la IA a sus métodos y, al mismo tiempo, desarrollar la capacidad de peritar la propia IA cuando esta intervenga en los hechos objeto de litigio. Ambas tareas exigen formación, investigación aplicada en contexto forense y guías de buenas prácticas que las sociedades científicas y las instituciones médico-legales deberían elaborar sin demora. La pregunta decisiva no es si la IA puede redactar un informe pericial —ya puede redactar textos que lo parecen—, sino si puede responder de él. Y esa responsabilidad, hoy por hoy, solo puede asumirla una persona.
Referencias
AlJuhani, A. A., Desoky, R. M., Binshalhoub, A. A., Alzahrani, M. J., Alraythi, M. S. y Alzahrani, F. F. (2025). Advances in postmortem interval estimation: A systematic review of machine learning and metabolomics across various tissue types. Forensic Science, Medicine and Pathology, 21(3), 1428–1446. https://doi.org/10.1007/s12024-025-01026-3
Alkaissi, H. y McFarlane, S. I. (2023). Artificial hallucinations in ChatGPT: Implications in scientific writing. Cureus, 15(2), Artículo e35179. https://doi.org/10.7759/cureus.35179
Aydogan, H. C., Yıkar, B., Balandız, H. y Özsoy, S. (2025). Assessing ChatGPT-4's ability to generate forensic reports: A study of artificial intelligence in forensics. Egyptian Journal of Forensic Sciences, 15(1), Artículo 30. https://doi.org/10.1186/s41935-025-00445-1
Ayers, J. W., Poliak, A., Dredze, M., Leas, E. C., Zhu, Z., Kelley, J. B., Faix, D. J., Goodman, A. M., Longhurst, C. A., Hogarth, M. y Smith, D. M. (2023). Comparing physician and artificial intelligence chatbot responses to patient questions posted to a public social media forum. JAMA Internal Medicine, 183(6), 589–596. https://doi.org/10.1001/jamainternmed.2023.1838
Bedi, G., Carrillo, F., Cecchi, G. A., Slezak, D. F., Sigman, M., Mota, N. B., Ribeiro, S., Javitt, D. C., Copelli, M. y Corcoran, C. M. (2015). Automated analysis of free speech predicts psychosis onset in high-risk youths. npj Schizophrenia, 1(1), Artículo 15030. https://doi.org/10.1038/npjschz.2015.30
Bérar, A., Allain, J.-S. y Bouvet, R. (2026). Could ChatGPT and co. replace forensic experts? A comparative study on medical liability expertise. International Journal of Legal Medicine, 140(4), 2533–2541. https://doi.org/10.1007/s00414-026-03777-2
Char, D. S., Shah, N. H. y Magnus, D. (2018). Implementing machine learning in health care—Addressing ethical challenges. New England Journal of Medicine, 378(11), 981–983. https://doi.org/10.1056/NEJMp1714229
Chekroud, A. M., Bondar, J., Delgadillo, J., Doherty, G., Wasil, A., Fokkema, M., Cohen, Z., Belgrave, D., DeRubeis, R., Iniesta, R., Dwyer, D. y Choi, K. (2021). The promise of machine learning in predicting treatment outcomes in psychiatry. World Psychiatry, 20(2), 154–170. https://doi.org/10.1002/wps.20882
Cockerill, R. G. (2020). Ethics implications of the use of artificial intelligence in violence risk assessment. Journal of the American Academy of Psychiatry and the Law, 48(3), 345–349. https://doi.org/10.29158/JAAPL.003940-20
Corcoran, C. M., Carrillo, F., Fernández-Slezak, D., Bedi, G., Klim, C., Javitt, D. C., Bearden, C. E. y Cecchi, G. A. (2018). Prediction of psychosis across protocols and risk cohorts using automated language analysis. World Psychiatry, 17(1), 67–75. https://doi.org/10.1002/wps.20491
Daubert v. Merrell Dow Pharmaceuticals, Inc., 509 U.S. 579 (1993). https://supreme.justia.com/cases/federal/us/509/579/
de Boer, H. H., Young, G., Bouwer, H. y Heath, K. J. (2026). ChatGPT's performance on a specialist forensic pathology examination: Implications for forensic pathologists and non-specialists. International Journal of Legal Medicine, 140(3), 1717–1724. https://doi.org/10.1007/s00414-025-03699-5
Dinis-Oliveira, R. J. y Azevedo, R. M. S. (2023). ChatGPT in forensic sciences: A new Pandora's box with advantages and challenges to pay attention. Forensic Sciences Research, 8(4), 275–279. https://doi.org/10.1093/fsr/owad039
Dobay, A., Ford, J., Decker, S., Ampanozi, G., Franckenberg, S., Affolter, R., Sieberth, T. y Ebert, L. C. (2020). Potential use of deep learning techniques for postmortem imaging. Forensic Science, Medicine and Pathology, 16(4), 671–679. https://doi.org/10.1007/s12024-020-00307-3
Douglas, T., Pugh, J., Singh, I., Savulescu, J. y Fazel, S. (2017). Risk assessment tools in criminal justice and forensic psychiatry: The need for better data. European Psychiatry, 42, 134–137. https://doi.org/10.1016/j.eurpsy.2016.12.009
Dressel, J. y Farid, H. (2018). The accuracy, fairness, and limits of predicting recidivism. Science Advances, 4(1), Artículo eaao5580. https://doi.org/10.1126/sciadv.aao5580
Dror, I. E. (2020). Cognitive and human factors in expert decision making: Six fallacies and the eight sources of bias. Analytical Chemistry, 92(12), 7998–8004. https://doi.org/10.1021/acs.analchem.0c00704
Dror, I. E. y Hampikian, G. (2011). Subjectivity and bias in forensic DNA mixture interpretation. Science & Justice, 51(4), 204–208. https://doi.org/10.1016/j.scijus.2011.08.004
Esteva, A., Kuprel, B., Novoa, R. A., Ko, J., Swetter, S. M., Blau, H. M. y Thrun, S. (2017). Dermatologist-level classification of skin cancer with deep neural networks. Nature, 542(7639), 115–118. https://doi.org/10.1038/nature21056
Fazel, S., Burghart, M., Fanshawe, T., Gil, S. D., Monahan, J. y Yu, R. (2022). The predictive performance of criminal risk assessment tools used at sentencing: Systematic review of validation studies. Journal of Criminal Justice, 81, Artículo 101902. https://doi.org/10.1016/j.jcrimjus.2022.101902
Fazel, S., Singh, J. P., Doll, H. y Grann, M. (2012). Use of risk assessment instruments to predict violence and antisocial behaviour in 73 samples involving 24 827 people: Systematic review and meta-analysis. BMJ, 345, Artículo e4692. https://doi.org/10.1136/bmj.e4692
Floridi, L., Cowls, J., Beltrametti, M., Chatila, R., Chazerand, P., Dignum, V., Luetge, C., Madelin, R., Pagallo, U., Rossi, F., Schafer, B., Valcke, P. y Vayena, E. (2018). AI4People—An ethical framework for a good AI society: Opportunities, risks, principles, and recommendations. Minds and Machines, 28(4), 689–707. https://doi.org/10.1007/s11023-018-9482-5
Fuermaier, A. B. M. y Niesten, I. J. M. (2025). ChatGPT helps students feign ADHD: An analogue study on AI-assisted coaching. Psychological Injury and Law, 18(2), 97–107. https://doi.org/10.1007/s12207-025-09538-7
Galante, N., Cotroneo, R., Furci, D., Lodetti, G. y Casali, M. B. (2023). Applications of artificial intelligence in forensic sciences: Current potential benefits, limitations and perspectives. International Journal of Legal Medicine, 137(2), 445–458. https://doi.org/10.1007/s00414-022-02928-5
Galatzer-Levy, I. R., McDuff, D., Natarajan, V., Karthikesalingam, A. y Malgaroli, M. (2023). The capability of large language models to measure psychiatric functioning (arXiv:2308.01834) [Preprint]. arXiv. https://doi.org/10.48550/arXiv.2308.01834
Garland, J., Ondruschka, B., Stables, S., Morrow, P., Kesha, K., Glenn, C. y Tse, R. (2020). Identifying fatal head injuries on postmortem computed tomography using convolutional neural network/deep learning: A feasibility study. Journal of Forensic Sciences, 65(6), 2019–2022. https://doi.org/10.1111/1556-4029.14502
Gerke, S., Minssen, T. y Cohen, I. G. (2020). Ethical and legal challenges of artificial intelligence-driven healthcare. En A. Bohr y K. Memarzadeh (Eds.), Artificial intelligence in healthcare (pp. 295–336). Academic Press. https://doi.org/10.1016/B978-0-12-818438-7.00012-5
Gershan, S. A., Schoenfeld, E. N. y Grabb, D. J. (2025). A pilot analysis investigating the use of AI in malingering. Journal of the American Academy of Psychiatry and the Law, 53(2), 147–156. https://doi.org/10.29158/JAAPL.240115-24
Ghassemi, M., Oakden-Rayner, L. y Beam, A. L. (2021). The false hope of current approaches to explainable artificial intelligence in health care. The Lancet Digital Health, 3(11), e745–e750. https://doi.org/10.1016/S2589-7500(21)00208-9
Goddard, K., Roudsari, A. y Wyatt, J. C. (2012). Automation bias: A systematic review of frequency, effect mediators, and mitigators. Journal of the American Medical Informatics Association, 19(1), 121–127. https://doi.org/10.1136/amiajnl-2011-000089
Grabb, D. J. y Angelotta, C. (2023). Emerging forensic implications of the artificial intelligence revolution. Journal of the American Academy of Psychiatry and the Law, 51(4), 475–479. https://doi.org/10.29158/JAAPL.230080-23
He, Q., Niu, X., Qi, R.-Q. y Liu, M. (2022). Advances in microbial metagenomics and artificial intelligence analysis in forensic identification. Frontiers in Microbiology, 13, Artículo 1046733. https://doi.org/10.3389/fmicb.2022.1046733
Kim, J., Leonte, K. G., Chen, M. L., Torous, J. B., Linos, E., Pinto, A. y Rodriguez, C. I. (2024). Large language models outperform mental and medical health care professionals in identifying obsessive-compulsive disorder. npj Digital Medicine, 7, Artículo 193. https://doi.org/10.1038/s41746-024-01181-x
Koutsouleris, N., Hauser, T. U., Skvortsova, V. y De Choudhury, M. (2022). From promise to practice: Towards the realisation of AI-informed mental health care. The Lancet Digital Health, 4(11), e829–e840. https://doi.org/10.1016/S2589-7500(22)00153-4
Kung, T. H., Cheatham, M., Medenilla, A., Sillos, C., De Leon, L., Elepaño, C., Madriaga, M., Aggabao, R., Diaz-Candido, G., Maningo, J. y Tseng, V. (2023). Performance of ChatGPT on USMLE: Potential for AI-assisted medical education using large language models. PLOS Digital Health, 2(2), Artículo e0000198. https://doi.org/10.1371/journal.pdig.0000198
Lee, P., Bubeck, S. y Petro, J. (2023). Benefits, limits, and risks of GPT-4 as an AI chatbot for medicine. New England Journal of Medicine, 388(13), 1233–1239. https://doi.org/10.1056/NEJMsr2214184
Levkovich, I. y Elyoseph, Z. (2023). Suicide risk assessments through the eyes of ChatGPT-3.5 versus ChatGPT-4: Vignette study. JMIR Mental Health, 10, Artículo e51232. https://doi.org/10.2196/51232
Ley 1/2000, de 7 de enero, de Enjuiciamiento Civil. Boletín Oficial del Estado, 7, de 8 de enero de 2000. https://www.boe.es/buscar/act.php?id=BOE-A-2000-323
Ley 35/2015, de 22 de septiembre, de reforma del sistema para la valoración de los daños y perjuicios causados a las personas en accidentes de circulación. Boletín Oficial del Estado, 228, de 23 de septiembre de 2015. https://www.boe.es/buscar/act.php?id=BOE-A-2015-10197
Ley Orgánica 10/1995, de 23 de noviembre, del Código Penal. Boletín Oficial del Estado, 281, de 24 de noviembre de 1995. https://www.boe.es/buscar/act.php?id=BOE-A-1995-25444
Mata v. Avianca, Inc., 678 F. Supp. 3d 443 (S.D.N.Y. 2023).
Mittelstadt, B. D., Allo, P., Taddeo, M., Wachter, S. y Floridi, L. (2016). The ethics of algorithms: Mapping the debate. Big Data & Society, 3(2). https://doi.org/10.1177/2053951716679679
Monaro, M., Toncini, A., Ferracuti, S., Tessari, G., Vaccaro, M. G., De Fazio, P., Pigato, G., Meneghel, T., Scarpazza, C. y Sartori, G. (2018). The detection of malingering: A new tool to identify made-up depression. Frontiers in Psychiatry, 9, Artículo 249. https://doi.org/10.3389/fpsyt.2018.00249
Murrie, D. C., Boccaccini, M. T., Guarnera, L. A. y Rufino, K. A. (2013). Are forensic experts biased by the side that retained them? Psychological Science, 24(10), 1889–1897. https://doi.org/10.1177/0956797613481812
Obermeyer, Z., Powers, B., Vogeli, C. y Mullainathan, S. (2019). Dissecting racial bias in an algorithm used to manage the health of populations. Science, 366(6464), 447–453. https://doi.org/10.1126/science.aax2342
Orrù, G., Monaro, M., Conversano, C., Gemignani, A. y Sartori, G. (2020). Machine learning in psychometrics and psychological research. Frontiers in Psychology, 10, Artículo 2970. https://doi.org/10.3389/fpsyg.2019.02970
Oura, P., Junno, A. y Junno, J.-A. (2021). Deep learning in forensic gunshot wound interpretation—A proof-of-concept study. International Journal of Legal Medicine, 135(5), 2101–2106. https://doi.org/10.1007/s00414-021-02566-3
Park, S.-J., Yang, S., Kim, J.-M., Kang, J.-H., Kim, J.-E., Huh, K.-H., Lee, S.-S., Yi, W.-J. y Heo, M.-S. (2024). Automatic and robust estimation of sex and chronological age from panoramic radiographs using a multi-task deep learning network: A study on a South Korean population. International Journal of Legal Medicine, 138(4), 1741–1757. https://doi.org/10.1007/s00414-024-03204-4
Petroni, G., Alaimo, S., Mandarelli, G., Catanesi, R., Niolu, C., Siracusano, A. y Pulvirenti, A. (2025). A case study of forensic psychiatry experts' reports analysis through large language models. International Journal of Law and Psychiatry, 102, Artículo 102122. https://doi.org/10.1016/j.ijlp.2025.102122
Piraianu, A.-I., Fulga, A., Musat, C. L., Ciobotaru, O.-R., Poalelungi, D. G., Stamate, E., Ciobotaru, O. y Fulga, I. (2023). Enhancing the evidence with algorithms: How artificial intelligence is transforming forensic medicine. Diagnostics, 13(18), Artículo 2992. https://doi.org/10.3390/diagnostics13182992
Price, W. N., II, Gerke, S. y Cohen, I. G. (2019). Potential liability for physicians using artificial intelligence. JAMA, 322(18), 1765–1766. https://doi.org/10.1001/jama.2019.15064
Real Decreto de 14 de septiembre de 1882 por el que se aprueba la Ley de Enjuiciamiento Criminal. Gaceta de Madrid, 260, de 17 de septiembre de 1882. https://www.boe.es/buscar/act.php?id=BOE-A-1882-6036
Real Decreto-ley 6/2023, de 19 de diciembre, por el que se aprueban medidas urgentes para la ejecución del Plan de Recuperación, Transformación y Resiliencia en materia de servicio público de justicia, función pública, régimen local y mecenazgo. Boletín Oficial del Estado, 303, de 20 de diciembre de 2023. https://www.boe.es/buscar/act.php?id=BOE-A-2023-25758
Reglamento (UE) 2016/679 del Parlamento Europeo y del Consejo, de 27 de abril de 2016, relativo a la protección de las personas físicas en lo que respecta al tratamiento de datos personales y a la libre circulación de estos datos y por el que se deroga la Directiva 95/46/CE (Reglamento general de protección de datos). Diario Oficial de la Unión Europea, L 119, de 4 de mayo de 2016, 1–88. https://eur-lex.europa.eu/eli/reg/2016/679/oj
Reglamento (UE) 2024/1689 del Parlamento Europeo y del Consejo, de 13 de junio de 2024, por el que se establecen normas armonizadas en materia de inteligencia artificial (Reglamento de Inteligencia Artificial). Diario Oficial de la Unión Europea, L, 2024/1689, de 12 de julio de 2024. https://eur-lex.europa.eu/eli/reg/2024/1689/oj
Roof, J. G. (2025). AI-assisted deception and the emerging challenge of LLMs in forensic psychiatry. Journal of the American Academy of Psychiatry and the Law, 53(2), 157–159. https://doi.org/10.29158/JAAPL.250022-25
Rudin, C. (2019). Stop explaining black box machine learning models for high stakes decisions and use interpretable models instead. Nature Machine Intelligence, 1(5), 206–215. https://doi.org/10.1038/s42256-019-0048-x
Singhal, K., Azizi, S., Tu, T., Mahdavi, S. S., Wei, J., Chung, H. W., Scales, N., Tanwani, A., Cole-Lewis, H., Pfohl, S., Payne, P., Seneviratne, M., Gamble, P., Kelly, C., Babiker, A., Schärli, N., Chowdhery, A., Mansfield, P., Demner-Fushman, D., … Natarajan, V. (2023). Large language models encode clinical knowledge. Nature, 620(7972), 172–180. https://doi.org/10.1038/s41586-023-06291-2
Štern, D., Payer, C., Giuliani, N. y Urschler, M. (2019). Automatic age estimation and majority age classification from multi-factorial MRI data. IEEE Journal of Biomedical and Health Informatics, 23(4), 1392–1403. https://doi.org/10.1109/JBHI.2018.2869606
Thali, M. J., Yen, K., Schweitzer, W., Vock, P., Boesch, C., Ozdoba, C., Schroth, G., Ith, M., Sonnenschein, M., Doernhoefer, T., Scheurer, E., Plattner, T. y Dirnhofer, R. (2003). Virtopsy, a new imaging horizon in forensic pathology: Virtual autopsy by postmortem multislice computed tomography (MSCT) and magnetic resonance imaging (MRI)—a feasibility study. Journal of Forensic Sciences, 48(2), 386–403. https://doi.org/10.1520/JFS2002166
Thirunavukarasu, A. J., Ting, D. S. J., Elangovan, K., Gutierrez, L., Tan, T. F. y Ting, D. S. W. (2023). Large language models in medicine. Nature Medicine, 29(8), 1930–1940. https://doi.org/10.1038/s41591-023-02448-8
Topol, E. J. (2019). High-performance medicine: The convergence of human and artificial intelligence. Nature Medicine, 25(1), 44–56. https://doi.org/10.1038/s41591-018-0300-7
Tortora, L. (2024). Beyond discrimination: Generative AI applications and ethical challenges in forensic psychiatry. Frontiers in Psychiatry, 15, Artículo 1346059. https://doi.org/10.3389/fpsyt.2024.1346059
Tortora, L., Meynen, G., Bijlsma, J., Tronci, E. y Ferracuti, S. (2020). Neuroprediction and A.I. in forensic psychiatry and criminal justice: A neurolaw perspective. Frontiers in Psychology, 11, Artículo 220. https://doi.org/10.3389/fpsyg.2020.00220
Tournois, L., Trousset, V., Hatsch, D., Delabarde, T., Ludes, B. y Lefèvre, T. (2024). Artificial intelligence in the practice of forensic medicine: A scoping review. International Journal of Legal Medicine, 138(3), 1023–1037. https://doi.org/10.1007/s00414-023-03140-9
Vila-Blanco, N., Carreira, M. J., Varas-Quintana, P., Balsa-Castro, C. y Tomás, I. (2020). Deep neural networks for chronological age estimation from OPG images. IEEE Transactions on Medical Imaging, 39(7), 2374–2384. https://doi.org/10.1109/TMI.2020.2968765
Walters, W. H. y Wilder, E. I. (2023). Fabrication and errors in the bibliographic citations generated by ChatGPT. Scientific Reports, 13, Artículo 14045. https://doi.org/10.1038/s41598-023-41032-5
Ward, L. J., Kling, S., Engvall, G., Söderberg, C., Kugelberg, F. C., Green, H. y Elmsjö, A. (2024). Postmortem metabolomics as a high-throughput cause-of-death screening tool for human death investigations. iScience, 27(5), Artículo 109794. https://doi.org/10.1016/j.isci.2024.109794
Zapf, P. A., Kukucka, J., Kassin, S. M. y Dror, I. E. (2018). Cognitive bias in forensic mental health assessment: Evaluator beliefs about its nature and scope. Psychology, Public Policy, and Law, 24(1), 1–10. https://doi.org/10.1037/law0000153
Este artículo ha sido redactado con ayuda de Inteligencia Artificial.


