Cómo OpenAI saqueó silenciosamente 10 millones de artículos de noticias — y por qué el mundo está atajado
Documentos internos revelan que OpenAI y Microsoft sabían que estaban obteniendo millones de artículos con derechos de autor sin permiso, y discutieron formas de saltarse los paywalls. Los juicios en curso en Nueva York podrían redefinir la frontera entre la innovación en IA y el robo de propiedad intelectual.
Un robo medido en artículos, no en dólares
La demanda presentada por The New York Times contra OpenAI y Microsoft reside en un tribunal de Manhattan, pero sus huellas dactilares se extienden por cada redacción del mundo. Lo que hoy surge de los documentos judiciales y los registros internos no es simplemente una disputa por derechos de autor; es un retrato de una industria que consumió sistemáticamente el periodismo mientras debatía abiertamente cómo eludir los mismos muros de pago que sostenían su financiación.
Según reportes que citan documentos judiciales, OpenAI extrajo más de 10 millones de artículos periodísticos sin autorización para entrenar sus modelos GPT. Esa cifra no es una estimación derivada de muestreos. Provienen de la revisión interna de Microsoft, realizada por Brent Heath, su director de ciencia aplicada, quien describió la actividad como “una escala sin precedentes de un robo asombroso” y “la mayor explotación laboral de la historia humana”.
El lenguaje importa. Heath no es periodista. Es un ejecutivo de la empresa que financia y distribuye la tecnología de OpenAI. Su caracterización, emitida internamente y no en un comunicado de prensa, señala que incluso quienes construían los sistemas comprendieron, en algún nivel, que lo que hacían se salía de la práctica aceptable.
El correo electrónico sobre el muro de pago que volvió a cruzar la línea
Quizás el detalle más demoledor en los documentos judiciales involucra un solo intercambio. Un investigador de OpenAI supuestamente le escribió a Greg Brockman, entonces presidente, describiendo un método para eludir el muro de pago de The New York Times. La respuesta de Brockman, según los documentos judiciales: “Ah, eso está bien”.
Leído literalmente, el intercambio sugiere dos cosas. Primero, la compañía realizaba investigaciones activas para eludir las barreras periodísticas —no por curiosidad académica, sino presumiblemente para expandir el corpus de contenido disponible para entrenamiento. Segundo, la dirección no opuso resistencia. La respuesta fue aprobación, o al menos aquiescencia.
Este es el detalle que envejecerá mal en cualquier retrospectiva sobre el boom de la IA. Durante años, la narrativa dominante presentó el desarrollo de la inteligencia artificial como una marcha imparable de la innovación, un avance que los periodistas tenían el deber de cubrir en lugar de un derecho que podían restringir. El correo electrónico sobre el muro de pago reformula la historia. Muestra una empresa que no veía los muros de pago periodísticos como modelos de negocio legítimos, sino como obstáculos que debían sortearse.
Por qué la cobertura coreana está agudizando el debate
La publicación coreana que informó estas acusaciones, Kumkang Ilbo, es notable no solo por los detalles que publica, sino por la agresividad de su enfoque. Medios en inglés como AFP, Financial Times y Wall Street Journal han cubierto los mismos documentos, pero los medios coreanos han perseguido la noticia con intensidad particular. Hay una razón para ello.
La industria noticiosa de Corea del Sur enfrenta la misma presión existencial de las prácticas de entrenamiento con IA que sus contrapartes americanas, pero con menos recursos legales y menos jurisprudencia en la que basarse. Los editores coreanos han visto su contenido absorbido por modelos como GPT sin acuerdos de compensación comparables a los que algunos medios estadounidenses están comenzando a negociar. Las historias que se desvelan ahora, sobre la conciencia interna, sobre eludir muros de pago, sobre el simple volumen de extracciones no autorizadas, validan temores que han circulado en Seúl durante años.
Lo que los lectores angloparlantes pueden no comprender del todo es cuánto de esta historia está siendo impulsada por estrategias legales no estadounidenses. Los editores coreanos y japoneses están persiguiendo demandas paralelas en sus propias jurisdicciones, construyendo una campaña de presión global que podría superar cualquier resultado en un tribunal estadounidense.
La defensa del uso legítimo y sus límites
OpenAI y Microsoft están presentando un argumento familiar: que usar artículos periodísticos con derechos de autor para entrenar IA constituye uso legítimo porque es transformador. El Departamento de Justicia de Estados Unidos ha presentado un escrito respaldando esta postura, advirtiendo que restringir la doctrina del uso legítimo perjudicaría la competencia en el mercado de la IA.
Pero el argumento del uso legítimo descansa en una premisa que los últimos documentos cuestionan. Tradicionalmente, el uso legítimo asume una colaboración de buena fe con la ley existente, no la circumvenza sistemática de muros de pago diseñados para monetizar el mismo contenido que se consume. Si el tribunal acepta los correos electrónicos sobre eludir muros de pago como evidencia de infracción intencional, la defensa del uso legítimo pierde gran parte de su fuerza moral y legal, sin importar lo que argumente el DOJ.
También existe una dimensión práctica. Una sentencia que proteja ampliamente el entrenamiento de IA bajo el uso legítimo transferiría efectivamente el valor económico del periodismo de las organizaciones periodísticas a las empresas tecnológicas, sin ningún mecanismo de redistribución. Esa es una consecuencia política, no solo legal, y los tribunales son cada vez más conscientes de la diferencia.
Quién gana, quién pierde y qué sigue
Si OpenAI y Microsoft pierden en Nueva York, los daños podrían medirse en billones, pero el verdadero costo sería estructural. Cada empresa de IA que entrene con texto con derechos de autor enfrentaría la misma exposición. Todo el modelo de la industria, construido sobre la suposición de que extraer datos es gratuito, requeriría renegociación.
Si ganan, el precedente consolidaría el arreglo actual: el periodismo como materia prima sin pago para una industria de varios trillones. Ese resultado aceleraría el colapso de los modelos de noticias basados en suscripciones, ya que los sistemas de IA entrenados con contenido con derechos de autor pueden replicar resúmenes, análisis e informes, exactamente los productos por los que los suscriptores pagan.
La cronología también importa. La demanda se presentó tres años después de que ocurriera la supuesta extracción. OpenAI y Microsoft tuvieron años para ajustar sus prácticas de datos. Sin embargo, las comunicaciones internas sugieren que continuaron operando bajo las mismas suposiciones bien entrado el proceso de entrenamiento. Esa persistencia socava cualquier reclamo de que la compañía posteriormente actuó de buena fe una vez alertada del problema.
La rendición de cuentas más amplia
Lo que se desarrolla en este caso no es simplemente una disputa por derechos de autor entre un periódico y una empresa tecnológica. Es el primer juicio importante sobre si la práctica fundacional de la industria de la IA, extraer internet para datos de entrenamiento, puede sobrevivir al escrutinio legal cuando ese internet incluye periodismo financiado por suscripciones.
La cifra de 10 millones es una referencia, no un techo. Otros editores en todo el mundo probablemente presentarán demandas similares, cada una contribuyendo a una arquitectura legal que podría redefinir lo que constituye el uso legítimo en la era de la inteligencia artificial. Los editores coreanos, ya activos en este espacio, estarán observando de cerca.
El resultado determinará si las redacciones permanecen como acreedores en la economía de la IA o simplemente como proveedores no pagados. No hay cantidad de retórica sobre uso legítimo que cambie esa pregunta fundamental.