Sabían que la web era un bucle fatal. Lo construyeron de todos modos.
Documentos judiciales desclasificados revelan que OpenAI y Microsoft advirtieron internamente que el scraping de su IA provocaría un 'bucle fatal' para el contenido web, un ciclo que aceleraron de todos modos. Lo que sus propias palabras exponen sobre el coste del crecimiento de la IA.
Los documentos que deberían haber encendido las alarmas
Los expedientes judiciales desclasificados en la demanda del New York Times contra OpenAI y Microsoft han producido una de las revelaciones más sinceras en la historia de la estrategia empresarial de la IA. Los propios documentos internos de las compañías advertían que su enfoque respecto al raspado de datos iniciaría un “círculo vicioso” que dañaría la web. Sus investigadores caracterizaron la escala de la cosecha de contenido como el “robo de trabajo más grande de la historia humana.” Su posicionamiento legal convirtió a la idea del uso legítimo en un “ridículo absoluto.”
Estas advertencias provenían del interior de las empresas. No se trataba de denunciantes filtrados ni de expertos hostiles. Eran escritos por personas empleadas precisamente para construir los sistemas que ahora están remodelando internet.
La voz más destacada corresponde a Brent Hecht, director de Ciencia Aplicada de Microsoft. Sus caracterizaciones son contundentes según cualquier estándar, pero no son ingenuas. Hecht comprendió lo que estaba ocurriendo porque estaba ayudando a diseñarlo. Y ahora su empresa intenta borrarlo del registro.
El control de daños de Microsoft
La respuesta de Microsoft ante las citas publicadas ha sido rápida y cuidadosamente contenida. El portavoz Alex Haurek declaró a The Verge que los comentarios reflejan “la perspectiva individual de un empleado, no constituyen un análisis legal y no representan las posiciones de la compañía.”
En un expediente separado, Jordan Usdan, gerente general de Microsoft para Estrategia y Operaciones de Datos, fue más lejos al caracterizar el rol de Hecht como adversarial. Lo describió como alguien que “mantiene puntos de vista divergentes, académicos y prospectivos sobre cómo deberían operar los ecosistemas de datos para la IA” y señaló que Microsoft lo emplea precisamente para aportar “puntos de vista asimétricos, futuristas y académicos.”
El encuadre es revelador. Microsoft no niega el contenido del análisis de Hecht. Lo que intenta es contener su autoridad: reducir una advertencia estructural a la personalidad de un solo investigador cuyas ideas son, por diseño, poco convencionales dentro de la compañía.
Pero el daño de esa distinción es limitado. El círculo vicioso no era una teoría marginal. Era una conclusión interna documentada. Y aunque Microsoft no quiera hacerse cargo de la frase exacta de Hecht, el resultado que predijo ahora se despliega a la vista de todos.
Google Zero no es una proyección. Es real.
El círculo vicioso que Hecht describió ya no es hipotético. Google Zero —el fenómeno en el que los resultados de búsqueda de Google devuelven cada vez más resúmenes generados por IA extraídos de contenido raspado en lugar de enlaces a fuentes originales— está activo y es medible. Cuando los modelos de IA consumen contenido web a escala, incentivan a los editores a restringir su material detrás de muros de pago o a eliminarlo por completo. A medida que el contenido original desaparece de la web abierta, los modelos de IA tienen menos material crudo del cual aprender. Los modelos se degradan. Las plataformas responden raspando aún más agresivamente de las fuentes abiertas restantes. Los editores retroceden más. El círculo se estrecha.
Ese es el círculo vicioso. Se retroalimenta a sí mismo. Y está ocurriendo ahora.
El New York Times no es el único editor que lo nota. Medios de todo el sector han reportado tráfico de referencia decreciente desde los motores de búsqueda, cambios en el comportamiento de almacenamiento en caché y esfuerzos activos para bloquear los rastreadores de IA. Algunos lo han logrado. La mayoría, no. La economía de la web abierta ya era frágil. La capacitación de modelos de IA ha acelerado la presión.
Quién paga por el círculo
El círculo vicioso no distribuye sus costos de manera equitativa. Los editores y creadores cargan con la carga inmediata: pérdida de ingresos publicitarios, reducción del tráfico orgánico, menor capacidad para monetizar su propio trabajo. Redacciones que financiaron el periodismo de investigación mediante suscripciones digitales y publicidad display están viendo compressarse esos flujos de ingresos mientras los intermediarios de IA capturan la atención sin contribuir al ecosistema de contenido.
La pregunta más grande es quién se beneficia del círculo. OpenAI y Microsoft han construido modelos que no existirían en los niveles de capacidad actuales sin acceso a décadas de contenido web creado por seres humanos. El margen de ese contenido, desde la perspectiva de las compañías que construyen los modelos, ha sido efectivamente cero. Los acuerdos de licencia que han cerrado —incluida la ampliamente reportada negociación con el New York Times— representan una corrección parcial, pero son acuerdos con los editores más prominentes. Los medios más pequeños, los periodistas independientes y los creadores de nicho no reciben ni compensación ni capacidad de negociación.
La asimetría es estructural. Un solo periódico puede negarse a licenciar su contenido. Una compañía de IA puede seguir raspándolo de todos modos y ajustarse. La incertidumbre legal favorece a la plataforma.
Lo que dicen Nadella y Altman importa menos que lo que hicieron
Los documentos judiciales también hacen referencia a declaraciones de Satya Nadella y Sam Altman. Ninguno de los dos hombres es inmune a la contradicción en el centro de esta situación: la retórica pública sobre una IA responsable convive con documentación interna que advierte que la estrategia actual de adquisición de datos es insostenible y potencialmente explotadora.
Esa contradicción no es exclusiva de OpenAI ni de Microsoft. Es la característica definitoria de una industria que construyó su narrativa de valoración sobre la promesa de abundancia mientras se preparaba en silencio para la escasez. Los modelos requieren cada vez más datos. La fuente de datos —la web abierta— está siendo degradada por el mismo proceso que la consume. Las compañías son conscientes de esta dinámica. Sus expedientes lo demuestran.
Las apuestas reales
Los documentos desclasificados importan porque despojan de abstracción. Este no es un debate sobre la doctrina del uso legítimo ni sobre la pregunta filosófica de si el análisis de texto y datos es inherentemente beneficioso. Es un registro de una compañía que comprende su propio comportamiento, documenta las consecuencias y continúa de todos modos.
La pregunta para los tribunales, los reguladores y el público no es si el círculo vicioso es real. Es si las compañías que lo predijeron deberían ser responsables de acelerarlo.
La respuesta a esa pregunta determinará la arquitectura de la web durante la próxima década. Si la trayectoria actual continúa, la web abierta se convierte en una zona de extracción de recursos: un lugar donde el contenido se extrae hasta que ya no es viable producirlo, y luego se abandona. Si se elige el camino opuesto, los incentivos cambian. Los editores ganan poder de negociación. Los creadores ganan compensación. El círculo se rompe.
Microsoft y OpenAI sabían hacia qué dirección se encaminaban. Los documentos lo dejan claro. Los casos legales que ahora se llevan a cabo decidirán si ese conocimiento importa.
Qué sucede después
Varios escenarios son plausibles. El más probable es un marco de settlement que extraiga pagos de licencia de los editores sin establecer un precedente claro para futuros casos. Esto brindaría un alivio temporal a las grandes organizaciones periodísticas mientras deja a los creadores más pequeños expuestos. El círculo vicioso continuaría, aunque a un ritmo ligeramente reducido.
Un escenario menos probable pero más trascendental sería un fallo judicial que establezca límites vinculantes al raspado de datos para la IA. Tal decisión transformaría la economía de toda la industria. Los modelos que dependen del acceso web irrestricto enfrentarían mayores costos de capacitación o reducciones en su capacidad. El mercado respondería en consecuencia: algunas compañías sobrevivirían, otras no.
La tercera posibilidad es la intervención regulatoria a nivel legislativo, potencialmente en la Unión Europea bajo el marco de la Ley de Servicios Digitales o en Estados Unidos mediante nueva legislación sobre derechos de autor. Esta vía es más lenta pero potencialmente más duradera que el litigio por sí solo.
Independientemente de cuál escenario se despliegue, los documentos internos ahora forman parte del registro público. Proporcionan evidencia de que las compañías involucradas comprendieron las consecuencias de su estrategia de datos. Ese conocimiento importará en los tribunales. También podría importar en la corte de la opinión pública, donde la narrativa sobre el desarrollo de la IA todavía se está escribiendo.