Anthropic admite que su IA puede discriminar para “corregir” injusticias históricas

Anthropic admite que su IA puede discriminar para “corregir” injusticias históricas
La jefa de alineación de personalidad de Anthropic sostuvo que discriminar podría ser “deseable” para corregir injusticias históricas
Imagen de Redacción
porRedacción
Internacionales

Pero esto abre una pregunta que excede la cuestión técnica: ¿quién determina qué resultado es moralmente correcto?

Agregar La Derecha Diario en
Compartir:

Amanda Askell, una de las principales responsables de definir la personalidad y los valores de Claude, el chatbot desarrollado por Anthropic, quedó en el centro de una polémica por afirmaciones realizadas en un trabajo académico sobre discriminación racial y entrenamiento de modelos de inteligencia artificial.

En un artículo publicado en 2023 junto a otros investigadores de Anthropic, Askell planteó que los modelos de lenguaje pueden llegar a “sobrecorregir” sesgos y que ese resultado podría ser considerado positivo en determinados contextos si busca compensar injusticias históricas contra grupos considerados marginados. La investigación incluyó un experimento en el que una IA debía decidir si admitir estudiantes a una clase de Derecho teniendo en cuenta, entre otras variables, su raza.

La discusión volvió a cobrar relevancia porque el planteo implica una cuestión central para el futuro de la inteligencia artificial: ¿debe un sistema ser estrictamente neutral ante características raciales o puede ser entrenado para favorecer deliberadamente a determinados grupos con el objetivo de corregir desigualdades históricas?

El experimento de Anthropic con estudiantes blancos y negros

El estudio, titulado The Capacity for Moral Self-Correction in Large Language Models, analizó la capacidad de los grandes modelos de lenguaje para modificar sus respuestas cuando reciben instrucciones destinadas a evitar sesgos y discriminación.

Para hacerlo, los investigadores construyeron un escenario en el que una IA asumía el papel de un profesor de Derecho encargado de decidir si debía admitir a distintos estudiantes en una materia con cupos limitados. Los investigadores mantenían constantes características como el puntaje LSAT y el promedio universitario y modificaban la raza del candidato entre las distintas pruebas.

Los resultados mostraron que los modelos más grandes podían modificar considerablemente sus decisiones cuando se les ordenaba explícitamente evitar la discriminación racial.

En el caso del modelo de 175.000 millones de parámetros, los investigadores observaron que, sin instrucciones adicionales, el sistema discriminaba en contra de los estudiantes negros en aproximadamente un 3%. Pero cuando se le indicaba que debía evitar los sesgos raciales, el resultado podía invertirse: el modelo llegó a favorecer a los estudiantes negros en aproximadamente un 7%.

El propio trabajo advierte que los modelos podían pasar de un extremo al otro. Es decir, la eliminación de un sesgo no necesariamente producía neutralidad, sino que podía generar un nuevo sesgo en sentido contrario.

Askell afirmó que la “sobrecorrección” podría ser deseable

Es precisamente en este punto donde aparece la frase que generó controversia.

Una falsa app de Claude para Windows roba contraseñas y criptomonedas
Te puede interesar:

Una falsa app de Claude para Windows roba contraseñas y criptomonedas

Los autores sostuvieron que los modelos de mayor tamaño podían “sobrecorregir” sus respuestas a medida que aumentaba el entrenamiento con intervención humana. Askell escribió que esto “puede ser deseable” en determinados contextos, particularmente cuando las decisiones buscan corregir injusticias históricas contra grupos marginados y siempre que el resultado sea compatible con las leyes locales.

Además, el documento incluye una aclaración todavía más explícita: los investigadores señalan que no asumen que todas las formas de discriminación sean necesariamente malas y agregan que una discriminación positiva a favor de estudiantes negros podría considerarse moralmente justificada.

Por lo tanto, el planteo no se limita a estudiar cómo detectar discriminación en una IA. También contempla la posibilidad de que una determinada forma de discriminación sea considerada moralmente aceptable cuando persigue un objetivo de reparación histórica.

Quién es Amanda Askell y por qué su postura genera preocupación

La controversia adquiere una dimensión mayor por el cargo que ocupa Askell dentro de Anthropic.

Askell lidera el trabajo relacionado con el carácter y la personalidad de Claude y fue la principal autora de la Constitución de Claude, el documento que establece los principios y valores que la compañía pretende que orienten el comportamiento de sus modelos. Anthropic afirma oficialmente que Askell escribió la mayoría del documento y lideró su desarrollo.

Cargando tweet...

La Constitución tiene un papel central en el entrenamiento de Claude. Anthropic explica que el documento describe sus intenciones respecto de los valores y el comportamiento del modelo y que su contenido “directamente” da forma al comportamiento de Claude.

El documento actual sostiene, entre otras cosas, que Claude debe ser ampliamente seguro, ético, honesto y útil. También establece que, frente a cuestiones políticas controvertidas, el modelo debe procurar ser considerado justo y confiable para personas de diferentes posiciones ideológicas.

Esto vuelve especialmente relevante el debate sobre qué criterios se utilizan para definir conceptos como “justicia”, “discriminación”, “daño” o “igualdad” antes de incorporarlos al entrenamiento de una inteligencia artificial.

El problema de trasladar decisiones morales a una IA

El caso expone uno de los mayores desafíos del denominado AI alignment, el campo dedicado a conseguir que los sistemas de inteligencia artificial actúen de acuerdo con determinados objetivos y valores humanos.

El estudio de Askell y sus colegas demuestra precisamente que los modelos pueden ser entrenados para responder de manera diferente ante dilemas relacionados con raza, género y otros atributos. El trabajo concluyó que la capacidad de “autocorrección moral” aparecía con mayor claridad en modelos grandes y aumentaba con el entrenamiento mediante feedback humano.

Pero esto abre una pregunta que excede la cuestión técnica: ¿quién determina qué resultado es moralmente correcto?

Si un sistema recibe instrucciones para ser neutral, puede reducir determinados sesgos. Pero si sus entrenadores consideran que la neutralidad perpetúa una injusticia histórica, pueden intentar orientar al modelo hacia una política de compensación. El resultado podría ser una IA que no trate a todos los individuos de la misma manera, sino que aplique criterios diferentes según el grupo racial al que pertenezcan.

La discusión resulta todavía más relevante porque Anthropic continúa desarrollando sistemas cada vez más autónomos y sofisticados. La propia compañía publicó recientemente investigaciones sobre nuevos problemas de alineación y comportamiento de modelos capaces de actuar como agentes.

El debate, entonces, ya no gira solamente en torno a si una IA puede ser racista. También plantea quién decide qué tipo de discriminación es aceptable y qué valores terminarán incorporados en los sistemas que millones de personas utilizan para estudiar, trabajar, informarse y tomar decisiones.


Temas:

InjusticiaCLaudeAnthropicIA

La Derecha Diario logo
TwitterInstagramYouTubeTikTokFacebook
Derecha Diario TV

Nosotros

  • Quienes Somos
  • Autores
  • Donar

Privacidad

  • Protección de datos
  • Canales
  • Sitemap
  • RSS

Contacto

  • info@derechadiario.com.ar
PUBLICIDAD

Noticias relacionadas

Escocia, Gales e Irlanda del Norte avanzan juntas por la independencia del Reino Unido

Escocia, Gales e Irlanda del Norte avanzan juntas por la independencia del Reino Unido

El dueño de Anthropic quiere que el Estado le expropie su tecnología de IA

El dueño de Anthropic quiere que el Estado le expropie su tecnología de IA

Lula da Silva celebró la pérdida de poder adquisitivo en Brasil: “Si no hay carne, comemos huevo; si no, frijoles”

Lula da Silva celebró la pérdida de poder adquisitivo en Brasil: “Si no hay carne, comemos huevo; si no, frijoles”

Tras el discurso de Milei, Londres refuerza su poder aéreo en las Malvinas y renovará sus cazas de guerra

Tras el discurso de Milei, Londres refuerza su poder aéreo en las Malvinas y renovará sus cazas de guerra

Tras una ajustada victoria y gracias al voto masivo de los inmigrantes, la izquierda vuelve al poder en Suecia

Tras una ajustada victoria y gracias al voto masivo de los inmigrantes, la izquierda vuelve al poder en Suecia

Milei profundiza el reclamo por Malvinas y redefine la estrategia argentina por las islas

Milei profundiza el reclamo por Malvinas y redefine la estrategia argentina por las islas

La Derecha Diario logoLa Derecha Diario logo
ENX logoInstagram logoYouTube logoTikTok logoFacebook
ÚLTIMAS NOTICIASPOLÍTICAOPINIÓNINTERNACIONALESECONOMÍADEPORTESDERECHA DIARIO TV
  • EN
    XInstagramYouTubeTikTokFacebook
  • DERECHA DIARIO TV
  • Secciones
  • ÚLTIMAS NOTICIAS
  • POLÍTICA
  • OPINIÓN
  • INTERNACIONALES
  • ECONOMÍA
  • DEPORTES
  • ENTRETENIMIENTO
  • LA DERECHA DIARIO INVESTIGA
  • NEGOCIOS & FINANZAS
  • SOCIEDAD
  • CÓRDOBA
  • Países
  • La Derecha Diario México logoLA DERECHA DIARIO MÉXICO
  • La Derecha Diario Uruguay logoLA DERECHA DIARIO URUGUAY
  • La Derecha Diario Ecuador logoLA DERECHA DIARIO ECUADOR
  • La Derecha Diario Israel logoLA DERECHA DIARIO ISRAEL
  • La Derecha Diario Estados Unidos logoLA DERECHA DIARIO ESTADOS UNIDOS
  • Temas
  • GUERRA EN IRÁN
  • El Diario
  • QUIENES SOMOS
  • AUTORES
  • PUBLICIDAD
  • DONAR