Zusammenfassung:
Einige führende Unternehmen für künstliche Intelligenz fördern die Mobiltelefonindustrie bei der Entwicklung von Geräten, die kontinuierlich große Sprachmodelle mit 100 Milliarden Parametern ausführen können, wobei die angestrebte Zeit bis 2028 zeigt. Diese Idee steht jedoch vor zwei praktischen Herausforderungen: Erstens erfordert der Betrieb eines so großen Modells eine große Speichermenge, und zweitens konkurrieren Rechenzentren für künstliche Intelligenz um globale Speicherproduktionskapazitäten, was zu einem knappen Angebot an Verbraucherspeicher und anhaltenden Preissteigerungen führt.

Qualcomm-CEO Amon sagte in einem Interview mit Fireside Alpha, dass einige Unternehmen an der Spitze der Branche der künstlichen Intelligenz Mobiltelefone erforschen, die kontinuierlich Hunderte Milliarden Parametermodelle ausführen können. Die konkreten Namen dieser Unternehmen nannte er nicht, relevante Aussagen zeigen jedoch, dass sich die Erwartungen der Unternehmen im Bereich der künstlichen Intelligenz an mobile Geräte ändern: In Zukunft könnten Mobiltelefone nicht mehr nur Terminals sein, die gelegentlich Cloud-KI-Dienste aufrufen, sondern Personal-Computing-Geräte, die kontinuierlich große Modelle lokal ausführen und aktiv Aufgaben erledigen können.
Allerdings ging es in Amons Aussage eher um die Beschreibung der von Branchenkunden vorgeschlagenen Ziele als um die offiziell angekündigte Produkt-Roadmap von Qualcomm. Derzeit hat Qualcomm noch keine vollständige Hardwarelösung bereitgestellt, mit der dieses Ziel im Jahr 2028 erreicht werden kann, und hat auch nicht versprochen, bis dahin ein kommerzielles Mobiltelefon mit entsprechenden Fähigkeiten auf den Markt zu bringen.
Aus technischer Sicht stellt das 100-Milliarden-Parameter-Modell viel höhere Anforderungen an die Hardware von Mobiltelefonen als derzeit gängige On-Device-KI-Modelle. Die Parameter eines großen Sprachmodells bestimmen die große Anzahl von Werten, die das Modell speichern und aufrufen muss, und diese Daten müssen normalerweise im Speicher gespeichert werden, damit der Prozessor während der Inferenz schnell darauf zugreifen kann.
Nehmen Sie als Beispiel ein Modell mit 100 Milliarden Parametern. Bei Verwendung der 4-Bit-Quantisierung benötigt jeder Parameter theoretisch nur 4 Bit Speicher, sodass nur die Modellparameter selbst etwa 50 GB Speicher benötigen. Im tatsächlichen Betrieb muss während der Inferenz außerdem Speicherplatz für das Betriebssystem, andere Anwendungen, den Kontextcache und temporäre Daten reserviert werden. Daher sind 50 GB nicht die volle Speicherkapazität, die ein Mobiltelefon benötigt, um das Modell reibungslos laufen zu lassen.
Wenn das Modell weiter auf 2 Bit quantisiert wird, benötigt jeder Parameter nur 2 Bit und der theoretische Speicherbedarf für Modellparameter kann auf etwa 25 GB reduziert werden. Diese Lösung erfordert jedoch immer noch eine Speicherkapazität von Mobiltelefonen, die weit über der von aktuellen Mainstream-Produkten liegt, und eine Quantisierung mit extrem geringer Präzision kann die Ausgabequalität des Modells erheblich beeinträchtigen, insbesondere bei komplexen Inferenzaufgaben.
Es ist zu beachten, dass die Anzahl der Parameter nicht direkt die volle Leistungsfähigkeit des Modells bestimmt. Die Trainingsdaten, die Architektur, die Trainingsmethoden und die Inferenztechniken verschiedener Modelle wirken sich alle auf die endgültige Leistung aus. Es ist durchaus möglich, dass ein kleines, optimiertes Modell bei einer bestimmten Aufgabe ein größeres Modell übertrifft. Auch wenn das Mobiltelefon das 100-Milliarden-Parameter-Modell derzeit nicht direkt ausführen kann, bedeutet dies nicht, dass es kein tatsächliches Nutzungserlebnis bieten kann, das dem eines großen Modells nahe kommt.
Derzeit besteht noch eine deutliche Lücke zwischen der Speicherausstattung von Smartphones und der Kapazität, die Hunderte Milliarden Parametermodelle benötigen. In der Vergangenheit verfügten einige Android-Flaggschiff-Telefone einmal über 24 GB LPDDR5X-Speicher. Angesichts des knappen Speicherangebots und der steigenden Preise begannen Mobiltelefonhersteller jedoch, den kommerziellen Wert von Versionen mit hohem Speicher neu zu bewerten. Für normale Verbraucher bedeutet eine Erhöhung der Speicherkapazität höhere Hardwarekosten, und für Mobiltelefonhersteller ist es schwierig festzustellen, ob Benutzer bereit sind, für den Betrieb größerer lokaler KI-Modelle mehr zu zahlen.
Dadurch entsteht ein Widerspruch: Unternehmen, die sich mit künstlicher Intelligenz befassen, hoffen, dass Mobiltelefone über immer leistungsfähigere lokale Rechenfähigkeiten verfügen, doch der dafür erforderliche Speicher wird immer teurer und schwieriger zu beschaffen.
Das weltweite Speicherangebot ist knapp, was eng mit der schnellen Expansion von Rechenzentren für künstliche Intelligenz zusammenhängt. Große Technologieunternehmen investieren weiterhin in KI-Server, die große Mengen an DRAM, Speicher mit hoher Bandbreite und Hochgeschwindigkeitsspeichergeräte benötigen. Auch Speicherhersteller achten bei der Produktionsplanung zunehmend auf Produkte mit künstlicher Intelligenz, die eine starke Nachfrage und höhere Gewinne aufweisen. Herkömmliche Speicher, die für Unterhaltungselektronikgeräte benötigt werden, stehen daher unter Versorgungsdruck.
Obwohl sich der in Smartphones verwendete Low-Power-DRAM und der in KI-Beschleunigern verwendete Speicher mit hoher Bandbreite in der Produktstruktur und den Herstellungsanforderungen unterscheiden, sind sie dennoch von Änderungen in der Produktionskapazitätszuteilung sowie von Marktangebot und -nachfrage in der gesamten Halbleiterindustrie betroffen. Je stärker die Nachfrage nach Speicher aus der KI-Infrastruktur ist, desto schwieriger wird es für Hersteller von Unterhaltungselektronik, die bisherigen Konditionen hinsichtlich Preis und Angebot aufrechtzuerhalten.
Dieser Druck spiegelt sich in den Herstellungskosten für Mobiltelefone wider. Eine zuvor veröffentlichte Analyse des Marktforschungsunternehmens Counterpoint Research ergab, dass die Preise für Smartphone-Speicher im zweiten Quartal 2026 im Vergleich zum Vorquartal um mehr als 80 % gestiegen sind. Bei Mobiltelefonen unterschiedlicher Preisklassen haben steigende Speicherkosten erhebliche Auswirkungen auf die gesamten Materialkosten.
Counterpoint wies darauf hin, dass die Stücklistenkosten von Mobiltelefonen der Mittelklasse im Vergleich zum Vorjahr um etwa 52 % gestiegen sind und der Speicher etwa 40 % der gesamten Stücklistenkosten ausmachte. Auch High-End-Mobiltelefone sind betroffen, und DRAM hat in einigen Flaggschiff-Mobiltelefonen sogar Chips auf Systemebene überholt und ist zur teuersten Einzelkomponente geworden.
Das bedeutet, dass Mobiltelefonhersteller nicht nur überlegen müssen, ob sie 50 GB oder mehr Speicher für 100 Milliarden Parametermodelle konfigurieren können, sondern auch eine realistischere Frage beantworten müssen: Sind Verbraucher bereit, für diese Speicher zu zahlen?
Wenn nur große Modelle betrieben werden sollen, muss der Speicher des Mobiltelefons von den derzeit üblichen 12 GB oder 16 GB auf 64 GB oder sogar mehr erhöht werden, und die Kosten für die gesamte Maschine können erheblich steigen. In Verbindung mit leistungsstärkeren Prozessoren, fortschrittlicher Verpackung und thermischem Design könnte der Preis des Endprodukts weiter von dem für normale Verbraucher akzeptablen Bereich entfernt sein.
Qualcomm und Apple versuchen, dieses Problem im Hinblick auf Chip-Architektur und Verpackungstechnologie zu entschärfen. In entsprechenden Berichten wurde erwähnt, dass Apple A20 Pro und Qualcomms Flaggschiff-Plattform Snapdragon der neuen Generation Chipdesigns und Speicherorganisationsmethoden erforschen, die für den Betrieb großer Modelle besser geeignet sind, in der Hoffnung, die Datenzugriffseffizienz zu verbessern und den Datenübertragungsaufwand zwischen Prozessor und Speicher zu reduzieren.
Die Verbesserung der Kapselung und der Datenzugriffseffizienz bedeutet jedoch nicht, dass der Bedarf an physischem Speicher automatisch verschwindet. Auch wenn der Prozessor den Speicher effizienter nutzen kann, muss das 100-Milliarden-Parametermodell selbst immer noch viele Parameterdaten speichern. Um Modelle dieser Größenordnung wirklich an Mobiltelefone anpassbar zu machen, muss die Branche möglicherweise weitere Durchbrüche bei der Modellkomprimierung, der Inferenzarchitektur und dem Speicherzugriff erzielen.
Eine mögliche Lösung ist eine radikalere Quantifizierungstechnologie. Durch die Reduzierung der Anzahl der pro Parameter verwendeten Bits kann das Modell in einem kleineren Speicherplatz ausgeführt werden. Allerdings ist die Quantifizierung nicht kostenlos. Bei Aufgaben, die komplexes logisches Denken erfordern, kann eine zu geringe numerische Genauigkeit zu einer erheblichen Verschlechterung der Modellleistung führen. Daher wird die Frage, wie man ein Gleichgewicht zwischen Speichernutzung und Modellqualität herstellt, zu einer wichtigen Forschungsrichtung für endseitige KI.
Eine weitere Lösung ist das Hybrid-Expertenmodell, also die MoE-Architektur. Im Gegensatz zu herkömmlichen intensiven Architekturen, bei denen für jede Inferenz das gesamte Modell aufgerufen werden muss, wählt das MoE-Modell einen Teil des Expertennetzwerks aus, um an Berechnungen basierend auf bestimmten Aufgaben teilzunehmen. Bei ordnungsgemäßem Design muss bei jeder Token-Verarbeitung nur ein kleiner Satz Parameter im Modell aktiviert werden.
Wenn die Experten-Offloading-Technologie weiter eingeführt wird, kann das System die derzeit benötigten Experten im DRAM behalten und die Experten, die nicht benötigt werden, vorübergehend im Flash-Speicher speichern. Wenn für den Inferenzprozess weitere Experten benötigt werden, werden die relevanten Daten von Flash-Speicher zu Speicher gelesen.
Dieser Ansatz kann die Datenmenge reduzieren, die sich das Modell gleichzeitig im DRAM befinden muss, allerdings auf Kosten eines erhöhten Speicherzugriffs und Datenübertragungsaufwands. Die Zugriffsgeschwindigkeits- und Latenzeigenschaften des in Mobiltelefonen verwendeten UFS-Flash-Speichers unterscheiden sich erheblich von DRAM. Wenn das Modell häufig Parameter aus dem Flash-Speicher liest, kann die Inferenzgeschwindigkeit beeinträchtigt werden.
Apple hat zuvor auch die Lösung untersucht, den integrierten Speicher des Geräts für die Ausführung großer Sprachmodelle zu nutzen. Es wird erwartet, dass diese Art von Technologie die Abhängigkeit von der DRAM-Kapazität verringert. Ob sie jedoch eine ausreichend niedrige Latenz, einen hohen Durchsatz und einen akzeptablen Energieverbrauch auf Mobiltelefonen erreichen kann, muss noch weiter überprüft werden.
Darüber hinaus führt der Dauerbetrieb großer Modelle auch zu Problemen bei der Wärmeableitung und der Akkulaufzeit. Der Innenraum von Mobiltelefonen ist begrenzt und sie können nicht mit großen Kühlsystemen wie Desktop-Computern oder Servern ausgestattet werden. Wenn der Prozessor über einen längeren Zeitraum eine hochintensive KI-Inferenz durchführt, kann die Chiptemperatur weiter ansteigen und anschließend den Frequenzreduzierungsmechanismus auslösen, was zu einer Leistungsverschlechterung führt.
Dieses Problem ist besonders akut für Agenten, die rund um die Uhr im Einsatz sein müssen. Herkömmliche Chatbots beginnen in der Regel mit der Verarbeitung von Aufgaben, nachdem der Benutzer eine Anfrage gestellt hat, aber die neue Generation von KI-Agenten muss möglicherweise Informationen kontinuierlich überwachen, den Kontext analysieren und zum richtigen Zeitpunkt proaktiv Vorgänge ausführen. Wenn das Telefon große Modelle rund um die Uhr betreiben muss, muss nicht nur der Speicher jederzeit verfügbar sein, sondern auch der Stromverbrauch des Prozessors und der Akkuverbrauch müssen streng kontrolliert werden.
Selbst wenn ein zukünftiges Mobiltelefon ein Modell mit 100 Milliarden Parametern erfolgreich laden kann, bedeutet dies nicht, dass es weiterhin mit der idealen Geschwindigkeit laufen kann. Ob das Modell wirklich im Speicher bleiben kann, wie viele Wörter es pro Sekunde verarbeiten kann, wie viel Wärme es während des Betriebs erzeugt und wie stark es sich auf die Akkulaufzeit auswirkt, sind alles wichtige Indikatoren zur Messung des tatsächlichen Nutzungswerts.
Im Vergleich zum direkten Anschließen eines 100-Milliarden-Parameter-Modells an ein Mobiltelefon könnte eine realistischere Lösung darin bestehen, ein destilliertes und optimiertes mittelgroßes Modell auszuführen.
Die Modelldestillation nutzt normalerweise die Fähigkeiten eines großen Modells, um ein kleineres Modell zu trainieren, sodass dieses die Leistung des großen Modells bei einer bestimmten Aufgabe so weit wie möglich beibehalten kann, während die Parameterskala erheblich reduziert wird. Wccftech glaubt, dass ein ordnungsgemäß destilliertes Modell mit 20 bis 30 Milliarden Parametern bei bestimmten Aufgaben an die Leistung eines Modells mit 100 Milliarden Parametern herankommen kann und daher besser geeignet ist, die Hauptkraft der lokalen KI in zukünftigen Smartphones zu werden.
Der Vorteil dieser Lösung besteht darin, dass sie nicht auf eine extrem große Speicherkapazität angewiesen ist und die Möglichkeit bietet, recht leistungsstarke Argumentationsfunktionen bereitzustellen. Für Mobiltelefonhersteller ist es besser, durch Modellarchitektur, Quantifizierung, Destillation und Inferenzoptimierung ein besseres tatsächliches Erlebnis mit begrenzten Hardwareressourcen zu erreichen, anstatt einfach nur darauf zu achten, wie viele Parameter berücksichtigt werden können.
Natürlich variiert die Leistung verschiedener Modelle stark, und ein Modell mit 20 bis 30 Milliarden Parametern kann das Modell mit 100 Milliarden Parametern nicht bei allen Aufgaben ersetzen. Fähigkeiten wie komplexes Denken, Fachwissen und die Verarbeitung langer Kontexte hängen immer noch von der Schulung und dem Architekturdesign bestimmter Modelle ab. Aus Sicht der Produktisierung kann es jedoch wertvoller sein, die meisten täglichen Aufgaben bei angemessenem Stromverbrauch und angemessenen Kosten erledigen zu können, als eine reine Parameterskala anzustreben.
Die Aussage des CEO von Qualcomm spiegelt auch wider, dass die Smartphone-Branche nach neuen Wachstumsrichtungen sucht. Da die marginalen Vorteile herkömmlicher Hardware-Upgrades allmählich abnehmen, hoffen Mobiltelefonhersteller, mithilfe von KI-Agenten die Art und Weise, wie Geräte verwendet werden, neu zu definieren.
Zukünftige Smartphones sind möglicherweise nicht mehr nur Geräte, die darauf warten, dass Benutzer Anwendungen öffnen und Befehle eingeben, sondern vielmehr persönliche Assistenten, die im Rahmen der Benutzerberechtigung kontinuierlich Bedürfnisse verstehen, Aufgaben arrangieren und verschiedene Dienste aufrufen können. Solche Systeme erfordern stärkere lokale Denkfähigkeiten sowie eine effizientere Speicherverwaltung, Rechenleistung mit geringem Stromverbrauch und Sicherheitsmechanismen.
Es besteht jedoch immer noch ein Abstand zwischen den Branchenzielen und dem Endprodukt. Amon gab weder den Namen des konkreten Partnerunternehmens bekannt, noch lieferte es eine vollständige Hardware-Roadmap oder einen Zeitplan für die Massenproduktion. 2028 lässt sich eher als Zielzeitpunkt verstehen, von dem einige KI-Unternehmen hoffen, diese Fähigkeit zu erreichen, und nicht als das von Qualcomm bestätigte Produktveröffentlichungsdatum.
Nach den aktuellen technischen Bedingungen zu urteilen, ist es für Mobiltelefone im Jahr 2028 nicht völlig unmöglich, Hunderte Milliarden Parametermodelle auszuführen, aber die Implementierungsmethode kann sich von der Vorstellung unterscheiden, indem man „alle vollständigen Modelle in den Speicher des Mobiltelefons lädt“. Eine aggressivere Quantisierung, MoE-Architektur, Experten-Offloading, dediziertes Speicherdesign und Modelldestillation können alle zum Erreichen des Ziels beitragen.
Gleichzeitig werden sich das globale Speicherangebot und die Preistrends direkt auf die kommerzielle Durchführbarkeit dieser Richtung auswirken. Wenn die Versorgung mit DRAM für Endverbraucher durch KI-Rechenzentren für lange Zeit eingeschränkt wird, sind die Hersteller möglicherweise nicht bereit, solche Produkte in großem Maßstab auf den Markt zu bringen, selbst wenn es technisch möglich ist, Mobiltelefone mit 64 GB oder mehr Speicher herzustellen.
Daher muss Qualcomms Vision eines 100-Milliarden-Parameter-Mobiltelefons wirklich nicht nur im Hinblick auf die Chipleistung umgesetzt werden, sondern auch im Hinblick auf das umfassende Gleichgewicht zwischen Modellgröße, Speicherkapazität, Herstellungskosten, Wärmeableitung, Akkulaufzeit und Verbrauchernachfrage. Für normale Benutzer wird es in Zukunft vielleicht nicht das Bemerkenswerteste sein, ob das Mobiltelefon ein Modell mit 100 Milliarden Parametern ausführen kann, sondern ob es zuverlässige, schnelle und wirklich nützliche lokale KI-Dienste bereitstellen kann, ohne den Preis wesentlich zu erhöhen oder die Akkulaufzeit ernsthaft zu beeinträchtigen.
Kommentare