Zusammenfassung:
Anfang Mai dieses Jahres ging ein fünf Sekunden langes Video von X viral. Dies ist eine Übertragung der Korean Professional Baseball League, die Hanwha Eagles spielen gegen die Doosan Bears. Die Kamera schwenkte auf eine Frau auf der Tribüne, die ein weißes Top und Jeans mit gekreuzten Beinen trug. Irgendwann schien sie zu seufzen und wegzuschauen, da sie mit dem Spiel unzufrieden wirkte.

Der Titel des Videos lautet „Gewöhnliche koreanische Frauen“. Zum Zeitpunkt der Veröffentlichung dieses Artikels wurde das Video 15,25 Millionen Mal abgespielt|Videoquelle: X @kangminlee
Doch bald erkannte eine Gruppe älterer Fans, dass etwas nicht stimmte. Auf der Anzeigetafel stand, dass der Schlagmann Cho Inseong war, aber Cho Inseong ging 2017 in den Ruhestand und ist jetzt Trainer bei Doosan.
Außerdem hat der Jubelslogan auf der Tribüne ein Wort mehr als der offizielle Slogan der Doosan Bears, der eine klare und wörtliche Übersetzung von AI zu sein scheint. Was diese Sendung betrifft, so war der Kommentar in einem typischen amerikanischen Akzent gehalten, was ebenfalls sehr verdächtig war.
Diese Frau existiert nicht, sie wurde von der KI erzeugt. Aber das Video verschwand nach der Veröffentlichung nicht. Stattdessen wurde es zur Vorlage. Alle steckten ihre Gesichter auf denselben Sendebildschirm und erstellten so ein von der Stadionkamera aufgenommenes Bild von sich selbst, das in den sozialen Netzwerken schnell große Popularität erlangte.

„Ich wurde von der Stadionkamera erfasst“ wurde schnell zu einer beliebten Vorlage|Fotoquelle: RADII
Jedes Mal, wenn die KI-Bildfunktionen verbessert werden, wird es fast immer einen beliebten Erfolg geben. Im März 2025 konnte GPT-4o beispielsweise Bilder zeichnen, und der Bildschirm war mit Fotos gefüllt, die im Stil von Ghibli-Animationen neu gezeichnet wurden; Ende August kam Googles Nano Banana auf den Markt. Jeder spielte es am liebsten, indem man Selfies in Figuren verwandelte, die man auf den Computertisch stellte. Nutzer haben in zwei Wochen mehr als 200 Millionen Bilder generiert.
Die beliebten Gegenstände werden jedes Mal geändert und die meisten davon basieren auf dem „Versetzen Sie sich hinein“-Gameplay. Aber dieses Mal wurde auf dem Spielfeld eine Sequenz enthüllt, die vorher nicht so offensichtlich war: Zuerst täuschte eine nicht existierende Schönheit zig Millionen Menschen und entwickelte dann eine Vorlage, die jeder spielen kann.
Schönheit ist keine Nebenrolle, die zufällig in der Szene auftaucht, sie ist eher ein Standardwert
.Dieser Standard ist ein halbes Jahrhundert älter als die KI. Im Jahr 1973, in den Anfängen der Bilddigitalisierung, wollte eine Gruppe von Ingenieuren eine neue Bildtechnologie testen und wählte dabei auch eine schöne Frau aus.
01
Die First Lady des Internets
Lena Soderberg begann ihre Karriere als Fotomodell in Chicago, Illinois. Zuvor war sie als Au-pair von Schweden in die USA gezogen. 1972 posierte sie für das Centerfold der Novemberausgabe des Playboy-Magazins. Diese Ausgabe des Playboy wurde mehr als 7,16 Millionen Mal verkauft und war damit die meistverkaufte Ausgabe des Magazins.
Die meisten Leute, die digitale Bildverarbeitung studiert haben, haben sie gesehen: mit einem breitkrempigen Hut, nackten Schultern und seitlich in die Kamera schauend. Im Laufe der Jahrzehnte wurden auf dieser Fläche unzählige Bildkomprimierungs- und Verarbeitungsalgorithmen getestet.

Lena Soderberg ist die First Lady des Cyber-Sektors | Bildquelle: SIPI IMAGE DATABASE
Im Jahr 1973 suchten Forscher am Signal Image and Processing Institute der University of Southern California nach einem neuen Bild für eine Forschungsarbeit. Sie haben ihren üblichen Vorrat an Testbildern erschöpft. In diesem Moment kam Berichten zufolge ein Kollege mit der Playboy-Ausgabe vom November 1972 herein. Als er die missliche Lage der Forscher erkannte, riss er einen 5,12-Zoll-Streifen von der Oberseite des Mitteleinsatzes ab und führte ihn in ihren Scanner ein.
Seitdem
ist dieses Bild in der Bildverarbeitungs-Community weit verbreitet und hat sich sogar zum Standard-Testbild der Branche entwickelt
.1996 schrieb David Munson, Chefredakteur von IEEE Transactions on Image Processing, einen kurzen Artikel, in dem er erklärte, wie dieses zufällig gescannte Bild zum Industriestandard wurde. Er nannte zwei Gründe. Der erste ist technischer Natur. Dieses Bild verfügt über alle Details, flachen Bereiche, Schatten und Texturen und eignet sich daher zum Testen von Algorithmen. Der zweite Artikel entspricht eher der menschlichen Natur:
Dies ist ein Foto einer attraktiven Frau. Es ist nicht verwunderlich, dass ein von Männern dominierter Forschungskreis davon angezogen wird
.Angesichts der Herkunft dieses Bildes war seine Verwendung nicht unumstritten. Im Jahr 1991 entdeckte der Playboy das Bild auf dem Cover einer wissenschaftlichen Zeitschrift, schickte einen Brief mit der Geltendmachung des Urheberrechts und ließ es schließlich fallen, sodass es weiterhin in der Forschung verwendet werden konnte. Der Vizepräsident des Unternehmens für neue Medien sagte, da es sich um ein Phänomen handelte, sei es besser, es auszunutzen.
Es gibt auch einige unterschiedliche Stimmen innerhalb der Bildverarbeitungsforschungsgemeinschaft. Sie stellten fest, dass Ingenieure kein Material aus Veröffentlichungen verwenden sollten, das als erniedrigend für Frauen angesehen werden könnte.
Sogar Lena selbst gab in der Dokumentation „Losing Lena“ an, dass sie hofft, dieses Bild nicht mehr zu verwenden.

In der Dokumentation hält Lena selbst das berühmte Foto von sich vor über 50 Jahren hoch | Bildquelle: IMDB
Aus diesem Grund akzeptiert die IEEE Computer Society ab dem 1. April 2024 keine Beiträge mehr, die dieses Bild verwenden.
Seit diesem Scan sind 51 Jahre vergangen
.02
Durchschnittliches Gesicht
Mittlerweile haben sich die Testfragen im Technikerkreis längst geändert.
KI kann kein volles Glas Rotwein trinken. Der Flüssigkeitsspiegel im Glas stoppt immer in der Mitte. Wenn die KI eine Uhr zeichnet, stoppen die Zeiger immer bei 10:10. Der Grund ist derselbe: Die meisten Rotweinfotos im Internet zeigen keine vollen Gläser, und die Konvention in der Uhrenwerbung besteht darin, sie bei 10:10 anzuzeigen. Das Modell reproduziert die Verteilung der Trainingsdaten und kann die Trägheit der Daten nicht beseitigen.

Die beliebteste Erklärung dafür, warum Uhrenanzeigen immer um 10:10 Uhr aufhören, ist, dass es wie ein „fröhliches Lächeln“ aussieht, aber vor den 1950er Jahren war es beliebter, bei 8:20 Uhr aufzuhören | Bildquelle: Reddit
Rotwein und Uhren sind der Beweis dafür, dass „Modelle nicht gut genug sind“. Aber wenn es um schöne Frauen geht, ist die Situation anders. „Ihre“ Trägheit stimmt zufällig mit der Ästhetik der Menschen überein.
Im Jahr 1990 führten die Psychologinnen Judith Langlois und Lori Roggman ein Experiment durch: Sie bildeten den mathematischen Mittelwert einer Reihe von Gesichtern, um ein neues Gesicht zu synthetisieren, und baten die Leute dann, es zu bewerten. Dadurch ist das synthetische Gesicht attraktiver als fast jedes reale Gesicht, das an der Synthese beteiligt ist, und je mehr Gesichter im Durchschnitt beteiligt sind, desto besser sieht das synthetische Gesicht aus. Dieser Effekt gilt sowohl für männliche als auch für weibliche Gesichter und für verschiedene ethnische Gruppen.
Der Titel der Arbeit lautet einfach
„Attraktive Gesichter sind nur durchschnittlich“
.Ähnliche Beobachtungen gab es schon früher. Im Jahr 1877 schrieb jemand an Darwin und teilte ihm mit, dass durch die Überlagerung zweier Porträts einer Dame mit einem Stereoskop das resultierende Gesicht jedes Mal deutlich schöner würde.
Der Kern des generativen Modells besteht eigentlich darin, eine Datenverteilung zu lernen und dann eine Stichprobe in der Nähe des Zentrums der Verteilung zu erstellen. Mit anderen Worten: Das Modell ist so programmiert, dass es durchschnittliche Gesichter zeichnet, und durchschnittliche Gesichter sind zufällig das, was Menschen als schön empfinden.
Die menschliche Psychologie in Kombination mit Maschinenprinzipien ist zur technischen Grundlage für Schönheit als Standardwert der KI geworden
.Eine Studie der Australian National University aus dem Jahr 2023 hat diese Kollision auf die Spitze getrieben. Psychologen fanden heraus, dass KI-generierte weiße Gesichter von Versuchsteilnehmern häufiger als „echt“ beurteilt wurden als echte weiße Gesichter. Forscher nennen es „KI-Hyperrealismus“ und erklären, dass es sich bei den Trainingsdaten hauptsächlich um weiße Menschen handelt und die vom Modell generierten Gesichter näher am Durchschnitt dieser Gruppe liegen und als typischer und eher wie echte Menschen wahrgenommen werden.
Nachdem Langlois‘ Experiment veröffentlicht wurde, erhielt er Kritik: Das synthetische Gesicht sehe nur deshalb gut aus, weil sich die Flecken und Unreinheiten auf der Haut bei der Mittelwertbildung leicht entfernen ließen. Diese Kritik war 1990 methodischer Natur.
Aber heute sieht es wie eine Prophezeiung aus.
Das typischste Merkmal von KI-Schönheiten ist eine übermäßig glatte Haut. Mehr als drei Jahrzehnte später bringen Faktenprüforganisationen den Menschen bei, KI-Bilder zu identifizieren, und einer der aufgeführten Mängel ist übermäßig glatte Haut. Dieses statistische Artefakt, auf das Kritiker vor mehr als drei Jahrzehnten hingewiesen haben, kennzeichnet die KI-Schönheiten des Jahres 2025.
03
Gips-Ei
Lena wurde in einem Labor ausgewählt. Der heutige Standardwert wird aus den Daten ermittelt.
Ende 2022 wurde die „Magic Avatar“-Funktion der Fotobearbeitungsanwendung Lensa plötzlich populär: Laden Sie ein paar Selfies hoch und schon generiert die KI hundert Porträts unterschiedlicher Stilrichtungen für Sie. Melissa Heikkilä, eine KI-Reporterin bei MIT Technology Review, generierte damit auch 100 Avatare von sich selbst, davon 16 oben ohne und 14 mit minimaler Kleidung und sexy Posen. Und ihre männlichen Kollegen waren allesamt Astronauten, Entdecker und Erfinder. Keiner von ihnen gab dem Modell während dieses Prozesses irgendwelche Hinweise.

Bild erstellt von Melissa über Lensa|Bildquelle: MIT TECHNOLOGE REVIEW
Melissa erklärte in ihrem Artikel, dass das Model dahinter anhand von Bildern aus dem Internet trainiert wurde und
das Internet bereits voller Fotos von spärlich bekleideten Frauen ist. Dies führt dazu, dass das Modell „leicht bekleidete Frauen“ als Standardwert generiert
.Dann wird die Trägheit des Benutzerverhaltens diese Tendenz weiterhin vorantreiben. Jede Generierung, Speicherung und Weiterleitung ist eine Abstimmung. Eine Studie aus dem Jahr 2025 zählte inhaltliche Veränderungen in der KI-Bild-Community Civitai: Der Anteil an NSFW-Bildern (erwachsenenorientiert) stieg von 41 % im Januar 2023 auf 80 % im Dezember 2024.
Abschließend schreibt der Hersteller diese Stimmen in das Modell ein. Damit das Bildmodell ansprechendere Bilder erzeugen kann, werden die Hersteller einen „Scorer“ ausbilden, der technisch als Belohnungsmodell oder ästhetischer Scorer bezeichnet wird. Seine Aufgabe besteht darin, zu lernen, welche Bilder die Leute für gut halten, und diesen Standard dann zum Trainieren des Modells zu verwenden: Gehen Sie bei einer hohen Punktzahl mehr in die Richtung und bei einer niedrigen Punktzahl weniger in die Richtung.
Einer der am häufigsten verwendeten Scorer heißt PickScore. Die Trainingsdaten stammen aus einer Webanwendung: Der Benutzer schreibt ein Aufforderungswort, das System gibt zwei Bilder aus und der Benutzer wählt das Bild aus, das ihm am besten gefällt.
Diese Daten werden überprüft und Benutzer, die NSFW-Inhalte generieren, werden ausgeschlossen, aber es sind immer noch viele NSFW-Aufforderungswörter beigemischt. Eine Studie aus dem Jahr 2024, in der Belohnungsmodelle untersucht wurden, ergab, dass die Verwendung von PickScore zur Feinabstimmung des Modells
selbst wenn die Aufforderungswörter nichts mit Sex zu tun haben, das Modell mehr NSFW-Bilder zeichnet
.Dann erscheint ein Bild: Der Inhaltsprüfer an der Rezeption fängt ab, aber der Bewerter am Backend zieht sich zurück. In den offiziellen Demos des Herstellers sind niemals NSFW-Schönheiten zu sehen, und die Generationsrichtlinien sind sehr streng. Aber wie wir alle wissen, sind die großen Modelle von heute nicht vollständig kontrollierbar. Es wurde durch den Geschmack des Benutzers trainiert, und der Geschmack des Benutzers ist in der Trägheit sehr weit gegangen.
In den 1930er Jahren beobachtete der niederländische Ethologe Niko Tinbergen eine Möwenart. Dieser Vogel legt kleine, hellblaue Eier mit grauen Flecken. Aber als er riesige, leuchtend blaue, schwarz gepunktete Gips-Attrappeneier neben das Nest legte, gaben die Vögel ihre eigenen Eier auf und kletterten auf die Gipseier, um sie auszubrüten. Er nannte diese übertriebenen Imitationen, die attraktiver als das Original sind, „übernatürliche Stimulation“.

Niko Tinbergen bemalt Eier während einer Outdoor-Expedition | Wissenschaft
Auch das menschliche Gesicht hat eine außergewöhnliche Reizwirkung und führt das Konzept „Der Durchschnitt ist das Schönste“ noch einen Schritt weiter. 1994 veröffentlichten David Perrett und andere eine Studie in Nature: Eine Gruppe der schönsten Gesichter wurde so zusammengestellt, dass sie sympathischer sind als das durchschnittliche Gesicht aller Menschen; und wenn der Unterschied zwischen ihm und dem durchschnittlichen Gesicht um 50 % vergrößert würde, wäre die Punktzahl sogar noch höher. Japanische und weiße Untertanen wählten die gleiche Richtung.
Unter den Mainstream-KI-Unternehmen hat mindestens eines diese Psychologie direkt in eine Produktfunktion umgesetzt. Die Bilderzeugung von Grok verfügt über vier Modi, von denen einer Spicy heißt. Wenn diese Option aktiviert ist, wird die Inhaltsfilterung gelockert, sodass anzügliche Inhalte und teilweise Nacktheit generiert werden können. Sie steht nur zahlenden Benutzern zur Verfügung.
Im Januar 2026 entdeckten Benutzer, dass sie Fotos von jedem hochladen konnten, um Grok „digital auszuziehen“. Zu den Opfern gehörten auch Kinder, und viele Regierungen schritten ein, um Druck auszuüben. X reagierte, indem es die Bilderzeugung insgesamt auf eine kostenpflichtige Funktion beschränkte.
Der Sprecher des britischen Premierministers kommentierte: Dies ist lediglich eine Funktion zur Generierung illegaler Bilder, die in einen kostenpflichtigen Dienst umgewandelt wird.
KI entwickelt sich zu der Gruppe von Menschen, die am häufigsten auf „Gefällt mir“ klicken
. Im Jahr 1973 bestand diese Gruppe überwiegend aus männlichen Laboren. Heute sind es die Nutzer, die am häufigsten klicken, am häufigsten weiterleiten und am häufigsten speichern. Die Vorliebe der Menschen für Schönheit hat eine biologische Grundlage. Babys im Alter von zwei bis drei Monaten schauen länger in Gesichter, die von Erwachsenen als attraktiv eingeschätzt werden.Lena, die First Lady des Internets, war ein Unfall. Die heutige Standardeinstellung besteht darin, dass das Modell aus der Mitte der Daten heraus wächst. Durch die Klicks des Benutzers wurde es immer weiter verbreitet, und schließlich legte jemand einen Preis fest.
Die statistischen Merkmale des KI-Generierungsmodells, die ästhetischen Vorlieben des Menschen für das „durchschnittliche Gesicht“ sowie Benutzerklicks und kommerzielle Anreize bilden eine Rückkopplungsschleife. Sie sind unabhängig voneinander, aber zusammen weisen sie zufällig in die gleiche Richtung und sind heute unsere Standardoption für den Konsum von Inhalten.
Kommentare