Textlänge

Im Rechtsstreit der New York Times gegen Microsoft und OpenAI sind zuvor versiegelte interne Unternehmensdokumente öffentlich geworden. Sie sollen zeigen, dass beide Konzerne früh vor Schäden ihrer KI-Datenstrategie am offenen Web gewarnt haben. Microsofts Director of Applied Science, Brent Hecht, bezeichnete das Scraping von Trainingsdaten intern als „größten Arbeitsdiebstahl der Menschheitsgeschichte“ und warnte, die eigene KI-Inhaltsstrategie habe einen selbstschädigenden „Doom Loop“ für Modelle und Web ausgelöst.

Laut den zitierten Auszügen hielt ein internes Microsoft-Papier fest, das eigene LLM-Geschäft bedrohe die wirtschaftlichen Grundlagen seiner „Content-Lieferkette“. Auch Konzernchef Satya Nadella wird zitiert, wonach Chatbots die klassische Suche im Wesentlichen ersetzt hätten. Mehrere Medien berichten zudem von stark gesunkenen Klickzahlen zu Verlags-Websites nach Einführung KI-generierter Zusammenfassungen, wobei genannte Prozentwerte zwischen den Berichten variieren.

Microsoft distanzierte sich offiziell von Hechts Aussagen und nannte sie dessen individuelle, nicht die Unternehmensposition widerspiegelnde Einschätzung. Eine ausführliche inhaltliche Reaktion von OpenAI liegt bislang nicht vor. Offen bleibt, welche weiteren Passagen der rund 92-seitige Schriftsatz enthält und wie sich die Zitate auf den Ausgang des Verfahrens auswirken.

Was passiert ist

Im Rechtsstreit der New York Times gegen Microsoft und OpenAI sind zuvor versiegelte interne Unternehmensdokumente öffentlich geworden. Sie sollen zeigen, dass beide Konzerne bereits früh intern davor gewarnt haben, dass ihre Praxis, Web-Inhalte für das Training von KI-Modellen zu nutzen, dem offenen Web und letztlich auch dem eigenen Geschäft schaden könnte. Die Klage der New York Times gegen die beiden Unternehmen läuft bereits seit Ende 2023 vor einem New Yorker Bundesgericht; die nun zitierten Passagen stammen aus einem rund 92-seitigen Schriftsatz der Klägerseite.

Im Zentrum der Berichterstattung steht Brent Hecht, Microsofts Director of Applied Science. Ihm zufolge betreibe die Branche mit dem Scraping von Trainingsdaten den „größten Arbeitsdiebstahl der Menschheitsgeschichte“, und Microsofts rechtliche Verteidigung mache „eine komplette Farce aus dem Konzept von Fair Use“. Ein internes Microsoft-Papier, das Hecht zugeschrieben wird, warnt zudem, die eigene KI-Inhaltsstrategie habe einen „Doom Loop“ ausgelöst, der gleichzeitig die Leistungsfähigkeit der eigenen Modelle und das gesamte Web schädige.

Was die Dokumente zeigen

Laut den zitierten Auszügen wird in einem internen Microsoft-Dokument festgehalten, es sei „höchst ungewöhnlich, dass ein Endprodukt die wirtschaftlichen Grundlagen seiner wesentlichen Zulieferer bedroht“ – genau das habe man mit dem eigenen LLM-Geschäft gegenüber der „Content-Lieferkette“ geschaffen. Auch Microsoft-Chef Satya Nadella wird zitiert, wonach Chatbots die klassische Suche im Wesentlichen ersetzt und die Notwendigkeit beseitigt hätten, direkt zur Quelle zu gehen.

Mehrere Medien berichten zudem übereinstimmend, dass in Gerichtsunterlagen von deutlich gesunkenen Klickzahlen auf Bing zu den Websites der Klägerinnen die Rede sei, nachdem KI-generierte Zusammenfassungen eingeführt wurden – teils wird ein Rückgang von über 90 Prozent genannt. Die genauen Zahlen variieren jedoch zwischen den Berichten, weshalb wir sie hier nur als Berichtslage und nicht als gesicherten Einzelwert wiedergeben. Zur Frage bezahlpflichtiger Inhalte wird ein OpenAI-Vertreter zitiert, wonach ihm keine gezielten Maßnahmen bekannt gewesen seien, um durch Paywalls geschützte Inhalte aus den Trainingsdaten zu erkennen oder zu entfernen – dies, obwohl Nadella an anderer Stelle erklärt haben soll, alles hinter einer Paywall müsse lizenziert werden.

Reaktionen der Unternehmen

Microsoft hat sich von Hechts Formulierungen offiziell distanziert. Ein Unternehmenssprecher erklärte gegenüber The Verge, die Aussagen spiegelten „die individuelle Perspektive eines einzelnen Mitarbeiters“ wider, seien „keine juristische Analyse“ und repräsentierten nicht die Position des Unternehmens. In einem separaten Schriftsatz habe ein weiterer Microsoft-Manager Hechts Rolle als bewusst gegensätzlich beschrieben: Er vertrete „abweichende, akademische und zukunftsgerichtete Ansichten“ darüber, wie Daten-Ökosysteme für KI funktionieren sollten, und spreche nicht für Microsoft.

Eine ausführliche inhaltliche Stellungnahme von OpenAI zu den zitierten Passagen liegt uns über die Presseberichterstattung hinaus nicht vor.

Was unklar bleibt

Offen ist, wie sich die veröffentlichten Zitate konkret auf den weiteren Verlauf des Verfahrens auswirken – etwa ob sie als Beleg für eine bewusste Umgehung von Urheberrechtsschutz gewertet werden könnten. Ebenso unklar bleibt, welche weiteren Passagen der rund 92-seitige Schriftsatz enthält, die bislang nicht öffentlich zitiert wurden, und ob OpenAI sich noch im Detail äußern wird. Die exakte Größenordnung des berichteten Rückgangs der Klickzahlen auf Verlags-Websites lässt sich aus der vorliegenden Berichterstattung nicht abschließend beziffern, da einzelne Medien unterschiedliche Prozentwerte nennen.

Einordnung

Der Fall reiht sich in eine wachsende Zahl von Rechtsstreitigkeiten zwischen Verlagen und KI-Unternehmen über die Nutzung urheberrechtlich geschützter Inhalte für das Training von Sprachmodellen ein. Bemerkenswert an den nun zitierten Dokumenten ist weniger der Vorwurf selbst – der seit Jahren von Verlegern erhoben wird –, sondern dass er dieser Darstellung zufolge in ähnlicher Form intern auch von Führungskräften der beklagten Unternehmen geteilt worden sein soll. Für die Debatte um das Phänomen sinkender Verweis-Traffic von KI-Suchfunktionen zu Ursprungsseiten, oft als „Google Zero“ bezeichnet, liefern die Dokumente damit zusätzlichen Diskussionsstoff – unabhängig vom juristischen Ausgang des Verfahrens.