Am 28. Juli gab Moonshot AI gestern Abend bekannt, dass es die Gewichte des Kimi K3-Modells als Open Source veröffentlichen, einen technischen Bericht veröffentlichen und gleichzeitig drei wichtige Infrastrukturtechnologien (Infra) öffnen werde: MoonEP, FlashKDA und AgentEnv. Diese Öffnung behandelt Modelle, Trainingsmethoden und zugrunde liegende Trainingssysteme. Entwickler können Modelle für die Bereitstellung und Sekundärentwicklung herunterladen. Der konkrete Nutzungsumfang muss der Kimi K3-Lizenz entsprechen.


Laut der offiziellen Einführung verwendet Kimi K3 eine Hybrid-Experten-Architektur (MoE) mit einer Gesamtparameterskala von 2,8 Billionen, nativen visuellen Verständnisfunktionen und Unterstützung für 1 Million Token-Kontextfenster. Im Vergleich zur Vorgängergeneration Kimi K2.5 wurde die Parameterskala von Kimi K3 um etwa das Dreifache erhöht. Die dunkle Seite des Mondes gab an, dass sich die Effizienz im Modellmaßstab bei begrenzten Rechenressourcen und unter Verwendung von Technologien wie Kimi Delta Attention, Attention Residuals und MoonEP um etwa das 2,5-fache erhöhte.

Gleichzeitig mit den Modellgewichten wird auch der technische Bericht zum Kimi K3 veröffentlicht. Laut öffentlichen Inhalten enthüllte der Bericht viele technische Details des Modelltrainings und des Architekturdesigns, einschließlich der hybriden Aufmerksamkeitsstruktur von KDA und Gated MLA, des Stable LatentMoE-Experten-Routing-Mechanismus, der visuellen Encoder-Trainingslösung MoonViT-V2 sowie Post-Modell-Trainings- und Bewertungsmethoden. Unter anderem übernimmt das Modell ein MoE-Design mit 896 Routing-Experten und 16 durch jeden Token aktivierten Experten und deckt das Training und die Bewertung mehrerer Fähigkeiten wie allgemeines Denken, Agent und Programmieragent ab.

Zusätzlich zum Modell selbst kündigte Dark Side of the Moon auch die Open Source wichtiger Infrastrukturtechnologien an, die das Kimi K3-Training unterstützen. Unter ihnen ist MoonEP eine Reihe leistungsstarker Experten-Parallelkommunikationsbibliotheken für große MoE-Modelle; FlashKDA ist Kimi Delta. Für den High-Performance-Computing-Betreiber, der Attention entspricht, zeigen offizielle Daten, dass seine Prefill-Geschwindigkeit auf NVIDIA H20 1,72 bis 2,22-mal höher ist als die Flash-Linear-Attention-Basislinie; AgentEnv ist ein von Dark Side of the Moon und KVCache.ai gemeinsam entwickeltes Agenten-Sandbox-System, das Funktionen wie schnelle Snapshots, Wiederherstellung und Fork unterstützen kann und in großen Agenten-Trainingsumgebungen verwendet wird.

The Dark Side of the Moon erklärte, dass diese Eröffnung darauf abzielt, die Entwicklung eines offenen gewichteten Modellökosystems zu fördern. Durch die Öffnung von Modellen, Trainingsmethoden und der zugrunde liegenden Infrastruktur soll die Schwelle für die Bereitstellung und Entwicklung von Modellen gesenkt und mehr wiederverwendbare technische Ressourcen für die KI-Community und die damit verbundene Forschung bereitgestellt werden.