Jung-Jin Ho, der Vater von HBM: Die Essenz der KI ist der Speicher, die GPU arbeitet tatsächlich nur zu 10 % der Zeit
Der als „Vater des HBM“ bekannte Professor Kim Jeong-ho der Korea Advanced Institute of Science and Technology (KAIST) wirft eine grundlegend neue Sicht auf: Das Wesen der KI ist der Speicher, nicht die GPU.
Vor Kurzem gab Prof. Kim Jeong-ho vom Fachbereich Elektrotechnik der Korea Advanced Institute of Science and Technology (KAIST) ein Videointerview, in dem er systematisch die Entwicklung der HBM-Technologie, die Landschaft der KI-Rechenleistung und zukünftige Halbleiterarchitekturen erläuterte. Kim Jeong-ho wird in der Branche als „Vater des HBM“ bezeichnet und arbeitete bereits Anfang der 2010er Jahre mit SK Hynix an der Entwicklung von HBM1, woraufhin er eine Reihe grundlegender Architekturforschungen leitete. Der Inhalt dieses Interviews verbreitete sich weitreichend in Technologie- und Investmentkreisen, wobei die Kernbotschaft direkt auf den strukturellen Widerspruch des aktuellen KI-Rechenleistungswettlaufs abzielt.

Im Interview präsentierte Kim Jeong-ho eine aufhorchende Zahl:
„Selbst wenn man eine Million GPUs installiert, beträgt die effektive Arbeitszeit nur 10%.“
Er erklärt: Jedes Mal, wenn ChatGPT ein Wort ausgibt, muss das System Daten aus dem HBM lesen, berechnen und zurück in den Speicher schreiben, „das Lesen und Schreiben nimmt nahezu die gesamte Zeit ein, die GPU wartet untätig daneben.“ Selbst durch Algorithmus-Optimierung lässt sich die GPU-Auslastung kaum über 30% steigern.
Dies ist der reale Beweis für Kim Jeong-hos zentrale These, die er seit Jahren vertritt: „KI ist gleich Speicher (AI = Memory).“
I. Warum stößt die GPU an die „Außenkommunikations-Sackgasse“?
Kim Jeong-hos Einschätzung zur aktuellen Lage von NVIDIA ist deutlich formuliert. Er sagt: Jensen Huang reist kürzlich häufig nach Korea, nimmt an Shows teil, isst frittiertes Huhn und trinkt Bier, trifft allerlei Persönlichkeiten — „so viele Treffen zeigen, dass er nicht beruhigt ist“.
„Das technische Wachstum der GPU ist nahezu gestoppt, das ist meine Einschätzung. Die Evolution des KI-Computers liegt in der Hand des Speichers.“
Seine logische Kette ist klar: Eine GPU kann ihre Leistung nur steigern, indem sie die Chipfläche vergrößert und mehr Recheneinheiten stapelt; aber GPUs werden zu heiß und benötigen auf der Rückseite Kühleinrichtungen, was vertikales Stapeln wie beim Speicher verhindert. „Die GPU steckt in einer Kommunikationssackgasse fest.“
Im Vergleich dazu wird im Übergang von der Trainings- zur Inferenz-Ära die Bedeutung des Speichers neu bewertet. Kim Jeong-ho sagt: „In der Inferenz-Ära ist entscheidender, wie viele Daten man in die KI einspeisen kann — und das entscheidende Halbleiterbauteil dafür ist der Speicher.“
Er betont weiter, der eigentliche Wettbewerb in der KI dreht sich um Speicherfähigkeit: „Google Gemini, OpenAI, Anthropic Claude – wer ist stärker? Es wird durch den Speicher entschieden – das ist meine These.“
II. Die zwei Kernelemente von HBM: Kapazität und Bandbreite
Kim Jeong-ho fasst die Bedeutung von HBM in zwei Dimensionen zusammen.
Erstens die Kapazität. Mit Context Engineering, multimodalen Eingaben und Agentic AI wächst der Speicherbedarf jährlich auf das Doppelte an – „zehn Jahre, das Tausendfache“. Klassisch wurde die Kapazität durch Verkleinerung der Transistoren gesteigert, doch nun stehen wir an der Grenze der Quantenmechanik und können kaum weiter verkleinern; deshalb muss „aufwärts gestapelt“ werden.
Zweitens die Bandbreite. Kim Jeong-ho vergleicht: „Wenn herkömmlicher Speicher eine 8-spurige Autobahn ist, entspricht HBM einer mit 1024 Spuren, jetzt sogar 2048, und in ein paar Jahren vielleicht einer Million Spuren.“ Nur durch parallele Kanäle, die riesige Datenmengen gleichzeitig übertragen, kann die Geschwindigkeit der KI-Berechnung erfüllt werden.
III. HBF: Die Ära des Stapelns von NAND-Flash
HBM löst das Geschwindigkeitsproblem, stößt aber bei der Kapazität an Grenzen. Kim Jeong-ho erläuterte im Interview ausführlich die nächste technologische Route: HBF (High Bandwidth Flash).
Kurz gesagt, HBF ist wie HBM, aber mit vertikal gestapeltem NAND-Flash. DRAM ist schnell, aber kapazitätsbegrenzt, NAND-Flash hingegen bietet große, dauerhaft speicherbare Mengen, ist zwar langsamer, aber für Inferenzszenarien ausreichend für „kalte Daten“.
Kim Jeong-ho glaubt, dass HBM und HBF künftig koexistieren werden, ähnlich wie Stadtplanung: „Wie ein Kaufhaus umgeben von Maisonetten und normalen Wohnungen, so bilden verschiedene HBMs und HBFs zusammen einen Verbund und versorgen die GPU mit Daten.“
Er gibt eine klare Langzeitprognose ab: „Jetzt ist die Ära des HBM, aber in zehn Jahren wird die Marktnachfrage nach NAND-Flash/HBF die nach HBM übersteigen. Samsung und SK Hynix müssen sich auf das HBF-Zeitalter vorbereiten.“
Er merkt an, zu den heutigen Entwicklern von HBF gehören SK Hynix, Sandisk, Samsung Electronics und das japanische Kioxia. Kioxia hat kürzlich Toyota im Börsenwert überholt und belegt Platz Eins in Japan; der Aktienkurs von Sandisk steigt weiter, während Samsung und SK Hynix ihre Marktführerschaft in Korea bewahren.
IV. HBS: Noch visionärere dritte Option
Kim Jeong-ho stellt auch das vorerst noch zukunftsweisende Konzept von HBS (High Bandwidth SRAM) vor.
SRAM (statischer RAM) ist rund 1000-mal schneller als DRAM, aber weniger dicht und deutlich teurer und wird traditionell nur als kleiner Zwischenspeicher auf Chips genutzt. Kim Jeong-hos Idee: Eine komplette 12-Zoll-Waferfläche als SRAM bauen, dann 12 bis 16 Lagen übereinanderstapeln – so wird die Kapazität von 100GB auf 1600GB erweitert.
„Damit ist nicht nur die Geschwindigkeit 1000-fach erhöht, sondern es ist auch genug Kapazität da. Das macht Sinn.“
Seine Vision vom ultimativen KI-Chip ist ein „100-stöckiges 3D-Gebäude“: HBM, HBF, HBS bilden jeweils mehrstöckige Gebäude, die GPU liegt oben zur Kühlung – dies ist die unausweichliche 3D-Semiconductor-Struktur für die KI-Computer der Zukunft – das ist meine heutige Einschätzung.“
Gleichzeitig gibt er offen zu: Die größte technische Herausforderung dieser Route ist nicht das Rechnen, sondern Stromversorgung und Kühlung: „GPU und gestapelter Speicher benötigen tausende Ampère Strom; das Design des Stromversorgungsnetzes wird die schwierigste Technologie, aber auch den wahren Wettbewerbsvorteil zwischen den Unternehmen ausmachen.“
V. Maßgeschneidertes HBM: Die Rollen von Anbieter und Abnehmer kehren sich um
Kim Jeong-ho geht speziell auf die Veränderung der Angebots- und Nachfragestruktur durch HBM4 ein.
Bisher war Speicher ein standardisiertes Produkt: Hersteller produzierten vorab, Kunden wählten, der Käufer bestimmte den Preis, das Lagerrisiko trugen die Produzenten – das ist der Kern des „Speicherzyklus“.
Ab HBM4 jedoch braucht es maßgeschneiderte Designs für die Accelerator-Architektur von Kunden wie NVIDIA, Google, AMD ("Customized HBM"), weshalb sich Speicherhersteller schon zu Beginn der Entwicklung Zusagen über Abnahmemengen einholen müssen – das sind die sogenannten „Langfristverträge (Long-term Agreements)“.
„KI-Unternehmen brauchen dringend leistungsfähiges HBM, deshalb stehen sie Schlange. Nun bestimmt der Anbieter den Preis – das ist ein Paradigmenwechsel.“
Er prognostiziert zudem: Künftig werden in HBM-Chips Kommunikationsfunktionen integriert, sodass „HBMs miteinander sprechen“, ähnlich einem Netzwerk-Verbund: „Wir stimmen uns selbst ab und geben jenen mehr Speicher, die uns besser behandeln; unkooperative GPUs erhalten keine Zuweisung.“
Das hebt die systemische Bedeutung der Speicherhersteller zusätzlich hervor.
VI. Samsung und SK Hynix sind die Einzigen, die beides gleichzeitig können
Im Interview betont Kim Jeong-ho wiederholt: Weltweit können derzeit nur Samsung Electronics und SK Hynix DRAM (HBM) und NAND-Flash (HBF) parallel in Massenproduktion fertigen.
„Sandisk und Kioxia haben zwar explodierende Aktienkurse, können aber nur HBF und nicht HBM herstellen. Samsung und SK Hynix besitzen die mächtigsten Werkzeuge für die Zukunft.“
Auf die Frage, ob die zusammen erwarteten Betriebsgewinne von Samsung und SK Hynix zwischen 500 und 600 Billionen Won in diesem Jahr realistisch sind, antwortet Kim Jeong-ho: „Realistisch.“ Er ergänzt, dass er oft technischen Austausch mit den Führungsetagen der beiden Unternehmen pflegt: „Der Glanz in ihren Augen wird immer heller.“
Dennoch merkt er an, dass der Wettbewerbsdruck real ist: Micron und Sandisk erhalten Aufträge von NVIDIA und Google und teilen damit Bestellungen auf.
VII. KI-PC und KI-Handy: Der Speicher bestimmt den Gerätepreis
Kim Jeong-ho führt die Speicherbedarf-Erzählung weiter bis zu Endgeräten aus.
Er prognostiziert: Künftig wird ein KI-PC für echte persönliche KI-Berechnung so viel Arbeitsspeicher benötigen, dass „ein PC einen Preis von 10 Millionen Won erreicht; der Speicherpreis bestimmt den PC-Preis“. Für ein KI-Smartphone (Preis 3 bis 5 Mio. Won) werden 2 bis 3 Mio. Won allein auf den Speicher entfallen.
„Die Entwicklung der KI-Infrastruktur und -Modelle erfordert immer mehr Speicher. KI-PCs und KI-Smartphones sind eine weitere Trendlinie daraus.“
VIII. Agentic AI und Physical AI: Speicherbedarf steigt um das 1000-fache
Auch Kim Jeong-hos Einschätzung zur Weiterentwicklung der KI ist beachtenswert. Er meint, mit dem Aufkommen von Agentic AI und Physical AI wird die Speichernutzung um etwa das 1000-fache steigen.
„KI-Agenten arbeiten 24 Stunden, müssen nicht schlafen wie der Mensch. Das Arbeitsvolumen explodiert, der Speicherbedarf natürlich ebenso. Dann beginnt das Zeitalter des 'Super-HBM', nicht mehr des jetzigen HBM.“
IX. Forschungslaufbahn: 50 Jahre Erfahrung, die „Sache mit dem Glück“
Zum Schluss des Interviews blickt Kim Jeong-ho auf seinen akademischen Werdegang zurück. 1993 promovierte er im Bereich ultraschnelle (Femtosekunden-)Messung von elektrischen Signalen. Sein Doktorvater erhielt vor ein paar Jahren den Nobelpreis für Physik. 1994 kam er zu Samsung Electronics Memory Division, 1996 zurück zu KAIST, wo er etwa zehn Jahre lang grundlegende Forschung zu Speicher und HBM betrieb, bevor daraus kommerzielle Produkte entstanden.
2015 hörte er auf einer internen Konferenz erstmals das Wort „Deep Learning“ und erkannte sofort, dass die gleichen mathematischen Prinzipien – lineare Algebra und Matrizenrechnung – bei KI-Algorithmen und HBM-Architekturen die Grundlage bilden. „Ich mochte Matrizen schon im zweiten Studienjahr – und beide Seiten wenden dieselbe Mathematik an – das ist eben Glück.“
Er scherzt, dass er HBM ursprünglich für Fernseher entwickelt hat, um die Darstellung lebhafter zu machen – und nie geahnt hätte, dass es die Grundlage des KI-Zeitalters werden würde: „Damals wusste ich das nicht, auch das kann man Glück nennen.“
Das folgende gekürzte Interview wurde teilweise von KI ins Deutsche übersetzt
Kim Jeong-ho: HBM, HBF und HBS bilden ein hundertstöckiges Gebäude, die GPU sitzt zuoberst und sorgt für Kühlung etc. Ich glaube, diese 3D-Halbleiterstruktur ist die unvermeidbare Architektur der KI-Computer der Zukunft. Eines der schwierigsten Technikprobleme ist dabei die Stromversorgung: Es werden einige tausend Ampère Strom benötigt, das Design des Stromversorgungsnetzes wird die größte technische Herausforderung und damit der Kern der Wettbewerbsfähigkeit.
Moderator: KAIST-Professor Kim Jeong-ho, bekannt als „Vater des HBM“, ist heute bei uns. Guten Tag!
Kim Jeong-ho: Guten Tag, sehr erfreut, danke für die Einladung.
Moderator: Vielen Dank, dass Sie sich Zeit genommen haben.
Kim Jeong-ho: Keine Ursache. (Lachen)
Moderator: Lassen Sie uns zuerst über HBM sprechen. In Wirklichkeit wurde HBM in großem Umfang erst vor etwa zwei Jahren produziert und eingesetzt, oder? Bei HBM3 zumindest. Bei HBM1 habe ich Anfang der 2010er Jahre mit SK Hynix daran gearbeitet, zu der Zeit war GPU-seitig NVIDIA und AMD im Spiel. Also begann HBM1 Anfang der 2010er als Grafikartenlösung.
Moderator: Sie haben in den 1990ern promoviert, richtig?
Kim Jeong-ho: Ja.
Moderator: Aber Sie begannen frühzeitig, bereits ab 2010 an HBM zu forschen?
Kim Jeong-ho: Ja. 1993 promovierte ich, damals war meine Forschung eher physikalisch geprägt. Ich fertigte das damals weltweit schnellste Oszilloskop für Laser-basierte Messung elektrischer Signale. Mein Doktorvater erhielt später den Physik-Nobelpreis. Das von mir entwickelte Messgerät erlaubte damals Einblicke in Femtosekunden-Phänomene. Heute, da in der KI riesige Datenmengen verarbeitet werden, sind digitale Schaltungen so schnell wie Pico- oder Femtosekundensignale. Die Erkenntnisse aus meiner Promotion vor 30 Jahren finden jetzt Anwendung.
Allerdings war das Forschungsgebiet damals sehr eng und tief, mein Charakter liegt aber auch in gesellschaftlichem Austausch. Deshalb dachte ich damals schon, dass Speicher in Zukunft sehr wichtig werden würde. Mit diesem Ansatz begann ich 1994 bei Samsung Electronics im Memory-Bereich. Seither habe ich durchgehend Speichertechnologie studiert. Ab 1996 kam ich zu KAIST, bis ca. 2010 führten wir gut zehn Jahre Grundlagenforschung zum HBM, woraus später das Produkt HBM entstand.
Für HBM notwendige Technologien wie Quantenmechanik, Halbleiterphysik, Mathematik etc. hatte ich bereits im zweiten und dritten Studienjahr gelernt. Vor allem viele Kenntnisse in linearer Algebra, das hatte ich schon 1981 gelernt und kann es bis heute anwenden. Für HBM haben wir einen bis HBM8 reichenden 30 Jahres-Fahrplan entwickelt. Vom Beginn der Forschung bis heute sind so insgesamt fast 50 Jahre vergangen.
Moderator: Haben Sie schon in der Frühphase Ihrer HBM-Forschung die KI-Ära vorhergesehen und, dass HBM der Kern davon werden würde?
Kim Jeong-ho: Nein, ursprünglich wollten AMD und NVIDIA HBM für Grafikkarten verwenden. Die Mathematik, die für Grafikkarten nötig ist, ist dieselbe wie für KI. Deshalb wurde HBM später zu einem Hauptbestandteil für KI, aber NVIDIA betrachtete es zunächst wirklich nur als Grafikkomponente. Und ich hatte ursprünglich daran gedacht, die Chips in Fernsehern einzusetzen, um das Bild lebhafter, ausdrucksstärker und naturgetreuer zu machen, weil die koreanische TV-Industrie sehr entwickelte war.
Erst in einer Besprechung mit jungen Professoren an der Uni um 2015 hörte ich das Wort „Deep Learning“, da steckte KI noch in den Kinderschuhen. Damals dachte ich nur: „Aha, es gibt so etwas“, habe das eigentlich nicht verstanden. Ab etwa 2015 habe ich dann aber meinen Forschungsschwerpunkt voll auf KI verlagert – auch wenn mein Labor offiziell weiter HBM erforscht hat. Nach einigen Jahren stellte ich fest, dass KI-Algorithmen und HBM wie füreinander gemacht sind. Da wusste ich: HBM wird sich explosionsartig im KI-Bereich durchsetzen.
Damit setzte es sich zunächst bei CNN (Kamerabilderkennung), später bei Reinforcement Learning (z.B. Go-Spiele) durch – all das sind Anwendungen mit hohen Anforderungen an Matrixrechnungen. Nur HBM kann so viel liefern. Aber zu dieser explosionsartigen Entwicklung kam es erst richtig ab den 2020ern mit ChatGPT. Die Zukunft der KI sind Agentic AI und Physical AI — was ihren Speicherbedarf im Vergleich zu heute um das 1000-fache steigern wird. Dann beginnt das Zeitalter des „Ultra HBM“. Ursprünglich hatte ich das nie so erwartet – das ist schlicht Glück. Weil ich schon im zweiten Studienjahr gerne lineare Algebra gemacht habe, und beide Seiten dieselbe Mathematik brauchen.
Moderator: Ich verstehe, HBM bedeutet, mehrere DRAMs zu stapeln, korrekt?
Kim Jeong-ho: Ja, das stimmt. Egal ob Grafikkarte oder KI – für Berechnungen muss man Daten sehr schnell aus dem Speicher lesen. Es gibt zwei Gründe, warum HBM nötig ist: Erstens viel Kapazität. Besonders, weil KI sich hin zum Context Engineering, Multimodalität und Physical AI entwickelt, wächst die in den Speicher zu ladende Datenmenge jedes Jahr um das Doppelte, also in zehn Jahren auf das Tausendfache. Um die Kapazität zu erhöhen, müsste man die Transistoren oder Speichereinheiten immer weiter verkleinern, aber wegen Interferenz und Leckströmen stoßen wir an die quantenmechanischen Grenzen. Mehr Kapazität ist also kaum noch möglich.
Deshalb habe ich in den frühen 2000ern gesagt, der Speicher muss in Zukunft gestapelt werden. Von da an war unser Motto „stacked statt flach“. Während die meisten nur einstöckige Halbleiter planten, lag unser Entwicklungsfokus auf gestapelten Designs. Wir haben vor allem das Design gemacht, Samsung und SK Hynix haben es umgesetzt; am Ende wurde daraus HBM. Zweitens: Auch wenn die Kapazität groß ist, müssen die Daten schnell an die GPU übertragen werden. Denn erst dann kann die Verarbeitung flüssig erfolgen — egal ob Texte, Dokumente oder neuerdings Filmproduktionen. Um die Geschwindigkeit zu steigern, braucht es parallele Übertragungswege. Stelle es dir wie eine Autobahn vor: Von 8 auf 1024, heute 2048 Spuren, in ein paar Jahren vielleicht eine Million.
Kern von HBM ist: Kapazität durch Stapelung erhöhen, und durch den Einbau von „Aufzügen“ und „Autobahnen“ Daten mit Lichtgeschwindigkeit (tausend- oder millionenfach schneller als herkömmlicher Speicher) parallel transferieren.
Moderator: Über HBM hört man auch viel von HBF. Was ist HBF, wie unterscheidet es sich von HBM?
Kim Jeong-ho: Es gibt zwei Hauptspeicherarten: DRAM und NAND Flash. DRAM ist schnell, speichert aber Daten nicht dauerhaft. NAND Flash hat etwa das Zehnfache an Kapazität, speichert Daten dauerhaft, ist dafür langsamer, z.B. in Kameras etc. HBM bietet durch Stapelung bereits mehr Kapazität, trotzdem reicht sie nicht. Im Context Engineering werden KI-Eingaben nicht mehr nur über Texte, sondern plus Referenzdokumente, YouTube-Videos etc. gespeist; Bild- und Videodateien explodieren, und der Speicherbedarf wächst weiter. Zwischenergebnisse (KV Cache) müssen ebenso gespeichert werden.
Im Agentic AI-Zeitalter betreibe ich vielleicht 10 oder 100 KI-Agenten, die rund um die Uhr arbeiten und mein Arbeitsvolumen verzehn- oder verhundertfachen – bei entsprechend massiv wachsendem Speicherbedarf. Selbst gestapeltes DRAM reicht dann nicht aus, daher die Idee, auch NAND Flash vertikal zu stapeln – das ergibt HBF. Heute entwickeln SK Hynix, Sandisk, Samsung Electronics und möglicherweise auch Kioxia HBF. Kioxia ist jüngst zum wertvollsten Unternehmen der japanischen Börse aufgestiegen. Auch die US-Hersteller Micron und Sandisk (beide ebenfalls am NAND Flash/HBF-Geschäft) ziehen nach, ebenso Samsung und SK Hynix in Korea.
Der direkt an die GPU gekoppelte Speicher kommt in zwei Formen: HBM und HBF („heißer Speicher“); für dauerhafte Nutzerinformation gibt es „kalten Speicher“. Beide Bereiche wachsen rapide. Langfristig wird die Marktnachfrage nach NAND Flash und HBF in ca. zehn Jahren möglicherweise die nach HBM übersteigen. Samsung und SK Hynix müssen sich also auch auf das HBF-Zeitalter vorbereiten — so meine Ansicht.
Moderator: Sie erwähnten, HBM könnte etwa 2038 in die achte Generation gehen?
Kim Jeong-ho: Ja.
Moderator: Wenn sowohl HBM als auch HBF dann im Markt sind – stehen sie in Konkurrenz oder ergänzen sie sich?
Kim Jeong-ho: Sie ergänzen sich. HBM4 erscheint dieses Jahr, in ein paar Jahren kommt HBM5, etwa alle drei Jahre eine neue Generation, nach 10 Jahren sind wir bei HBM8. Dann werden HBM und HBF zusammen eingesetzt. HBM bietet wenig Kapazität, ist extrem schnell, HBF ist ein bisschen langsamer, hat teils physikalische Grenzen, erreicht aber riesige Volumina. Reicht der Platz bei HBM nicht, hilft HBF aus. Die beiden existieren nicht einzeln, sondern bilden eine Art Block: Im Zentrum das Kaufhaus (HBM), drumherum Hochhäuser (HBF). Sie sind als Verbund miteinander verbunden und versorgen den Kunden. Insgesamt wird die Kapazität von HBF größer sein als die von HBM.
Moderator: Im Grunde ist das der Unterschied DRAM-Stapelung zu NAND-Flash-Stapelung, oder? Beides ist nötig.
Kim Jeong-ho: Ja, und weltweit können nur Samsung und SK Hynix beides zugleich. Sandisk und Kioxia (deren Aktie so boomt) können nur HBF (bzw. stapelbare NAND-basierte ESSD-Technik), aber kein HBM. Samsung und SK Hynix besitzen meiner Meinung nach das stärkste künftige Werkzeug.
Moderator: Sind Samsung und SK Hynix damit uneinholbar vorne?
Kim Jeong-ho: Ja. Heute Morgen hat die Aktie doch die 9000 geknackt? Ich mache zwar keine Aktienprognosen, aber der grundlegende globale Trend geht in Richtung KI-Vormachtstellung. Die Stärke der KI wird – so meine Überzeugung – durch die Speicherfähigkeit bestimmt. Bis letztes Jahr dachte ich, KI-Kompetenz stecke in der Mathematik (z.B. Attention-Mechanismen), aber sie ist abhängig vom Speicher. Am Ende ist die Speicherleistung gleich der KI-Leistung. Deshalb definiere ich „AI = Memory“. KI-Unternehmen, KI-Nationen oder die Halbleiter für Data Centers – sie sind alle auf Speicherkonzerne angewiesen. Das ist eine neue Ära mit anderer Dynamik.
Noch bemerkenswerter: HBM und HBF bauen jetzt KI-Rechenzentren, genannt „AI-Fabrik“ – Fabriken, die KI produzieren. Ich nenne es jetzt „Memory-Fabrik“. Das Herz der KI-Fabrik ist der Speicher und wie viel Speicher man hat, entscheidet über die KI-Herrschaft eines Landes oder Unternehmens. Google, Gemini, OpenAI, Anthropic Claude – wer ist besser? Aus meiner Sicht: Es hängt vom Speicher ab!
Kürzlich tauchten mit Blick auf Datenschutz Trends auf, bei denen KI-Berechnungen auf dem eigenen PC ablaufen, also sogenannte AIPC. NVIDIA will das auch machen, baut mit TSMC entsprechende PCs mit 128 GB LPDDR-Speicher, d.h. viel mehr Kapazität. Richtig gut wird es erst mit TI-level Speicher – nur dann kostet ein PC aber 10 Mio. Won, weil der Speicher dominiert. Bald werden auch Smartphones zu KI-Phones – vielleicht mit nur noch einem Fenster auf dem Display – und viele Aufgaben übernimmt dann KI oder eine KI-Brille. Ich schätze, dass künftig bei einem 3 bis 5 Mio. Won teurem KI-Handy 2 bis 3 Mio. Won reine Speicherkosten sein werden. Je mehr in KI-Infrastruktur und -Modellen passiert, desto größer der Speicherbedarf, KI-PC und KI-Handy sind neue Wachstumslinien.
Moderator: Unter den Tech-Riesen der Welt ist NVIDIA derzeit leistungsstärkster Player. Was ist deren Erfolgsgeheimnis?
Kim Jeong-ho: Bis letztes Jahr war KI-„Training“ (Learning) wichtiger – die Trainingsfähigkeit bestimmte die KI-Stärke. In Lernprozessen – z.B. beim Transformer-Modell – erledigt der Encoder Backpropagation und Differenzieren, das kann eine GPU besonders gut. Die Trainings-Ära war die Ära der GPU, man musste sie kaufen um KI zu entwickeln – deshalb der Hype und die hohen Preise. Seit Sommer letzten Jahres ist „Inference“ wichtiger, denn allein mit Training löst man das „Hallucination“-Problem nicht (verrückte, falsche Antworten machen KI nutzlos). Für personalisierte KI wird Inferenz immer bedeutender; hier ist der Speicher das Schlüsselhalbleiterbauteil. Mit dem Aufkommen der Inferenz-Ära werden Speicher teurer und gefragter als GPUs.
Ein weiterer Punkt: Wer eine GPU leistungsfähiger machen will, muss sie größer (also mehr Recheneinheiten) machen. Manche (wie Cerebras) machen den kompletten 12-Zoll-Wafer zur GPU – aber ein Defekt wiegt dann schwer. Trotzdem kommt auch Cerebras nicht ohne HBM/HBF aus. Ohne Speicher ist Inferenz schwach. NVIDIA kann die GPU nicht stapeln, es wird zu heiß, hinten muss ein Kühler dran, daher kann man sie nicht vertikal bauen – ein echtes Dilemma. Jensen Huang wirkt zurzeit nervös, besucht TV-Shows, wirft Baseballs, trifft Promis – ein Zeichen innerer Unruhe. Ich glaube, die technische Fortentwicklung von GPU ist faktisch zum Stillstand gekommen. Die Weiterentwicklung von KI-Computern hängt allein am Speicher.
Moderator: Stimmt es, dass nur 10% der installierten GPUs tatsächlich genutzt werden?
Kim Jeong-ho: Ja. Selbst bei einer Million installierter GPUs liegt die Nettoaktivität vielleicht nur bei 20%, teils sogar 10%. Warum? Weil ständig Daten aus Speicher (HBM/HBF) geholt werden müssen, damit die GPU weiterrechnen und Ergebnisse liefern kann – aber die Daten kommen nicht schnell genug nach. Wenn ChatGPT schnell Wörter generiert, muss jedes Mal Daten aus HBM/HBF gelesen, berechnet und zurückgeschrieben werden; fast die ganze Zeit geht fürs Lesen/Schreiben drauf, die GPU wartet. Entscheidend ist deshalb, wie schnell und wieviel gelesen werden kann – das ist der Grund, warum HBM/HBF so wichtig sind. Selbst die beste Software bringt nichts, wenn die GPU effektiv nur 30% ausgelastet ist und den Rest der Zeit leer läuft.
Moderator: Sie vertreten die These, in Zukunft werden GPU-Funktionen direkt in HBM/HBF integriert, stimmt das?
Kim Jeong-ho: Ja. Wenn die GPU auf HBM/HBF warten muss, dann kann man die Berechnung auch gleich dort erledigen: Zum Beispiel wird die GPU wie ein Erdgeschoss in einem Hochhaus, der Datentransport in den Gebäudelagen ist viel schneller, die „Laufwege“ entfallen. Ich plädiere dafür, die CPU/GPU direkt in den HBM zu integrieren oder die GPU in den Hintergrund zu rücken. Natürlich muss sie sinnvoll ausgelastet bleiben! – Das nennt man „Memory-Centric Computing“. Ab HBM4 geht es in diese Richtung.
Moderator: Würde das GPU-Problem in HBM/HBF gelöst, gibt es dann kein Hitzeproblem mehr?
Kim Jeong-ho: Es gibt noch ein wenig Abwärme. Ab HBM4 sieht man Leistungsvergleiche bei SK Hynix und Samsung, die entscheidend von der Kühlung abhängen: Wie viel Wärme sich abführen lässt, bestimmt am Ende die Performance, und das gilt auch für GPUs. Meine Labor-Idee ist: Wenn eine Lage zu heiß ist, verteilt man die Funktionen auf die „Dachterrasse“ (Top Floor) und installiert einen Kühlturm für direkte Abkühlung von oben. Eines unserer Kernarchitekturen ist in der HBM5-Forschung implementiert; unsere Master- und PhD-Studenten arbeiten daran, und wir hoffen auf große Erfolge.
Veröffentlichen wir solche Arbeiten, schauen NVIDIA, AMD, Samsung und SK Hynix darauf, lehnen sie anfangs vielleicht ab – sehen dann aber doch, dass es keinen anderen Weg gibt.
Moderator: Wenn diese Integration der GPU in HBM/HBF oder sogar der CPU gelingt, werden Samsung und SK Hynix noch stärker, korrekt?
Kim Jeong-ho: Ja, das bietet ihnen große Chancen. „Stärker zu werden“ heißt, mehr Gestaltungsmacht zu bekommen – möglicherweise am Ende sogar NVIDIA zu übertreffen. Dafür braucht es jedoch technologische Entwicklung, Investitionen, Talent-Entwicklung und eine vorausschauende Unternehmensführung. Das Management ist dabei entscheidend.
Moderator: Sie vertreten, „das Speicher-Zeitalter ersetzt das GPU-Zeitalter“. Das scheint begonnen zu haben. Dennoch treten zuletzt „NPU“ auf – was ist das?
Kim Jeong-ho: Das sind auch Prozessoren, spezialisierte Matrizenrechner für KI. GPU war ursprünglich GPGPU, auch TPUs enthalten HBM, alles braucht HBM/Speicher. Gemini z.B. kann schreiben, Sprache verarbeiten, malen. Andere Chips sind spezialisiert, etwa nur auf Text, das ist dann NPU. Manche sprechen auch von LPU. Das sind Rechner für KI, die auf den Einsatzbereich angepasst, kleiner, stromsparender und günstiger sind. In Südkorea gibt es Firmen wie Rebellions, FuriosaAI und HyperExcel, weltweit sind es etwa ein Dutzend; aber alle benötigen für Höchstleistung HBM.
Moderator: FuriosaAI und Rebellions wurden kürzlich massiv finanziert, um als Konkurrenz zu NVIDIA aufzutreten. Können Sie wirklich global konkurrieren?
Kim Jeong-ho: Ich war einer der Gutachter. Die Überlegung ist: NVIDIA kann nicht alle Märkte abdecken; bei NPU, TPU gibt es Nischenmärkte. Beispielsweise verwendet ein saudi-arabisches Rechenzentrum ohne US-Produkte zu hohe Abhängigkeiten; man könnte also 10% alternative Lösungen einbauen – hier haben südkoreanische NPU-Firmen Chancen. Für südkoreanische KI-Rechenzentren (benötigen wohl Millionen Geräte) wäre 100% nur mit NVIDIA zu abhängig vom Ausland, daher die Förderung koreanischer Anbieter. Technisch gibt es auch eigene Stärken.
Moderator: Sie sprachen zuletzt von Ihrem Konzept für „High Bandwidth SRAM (HBS)“?
Kim Jeong-ho: Ja, ein von mir jüngst entwickeltes Konzept. Wie gesagt, ich liefere die Konzepte, die Umsetzung braucht dann enormen Einsatz von Samsung, SK Hynix usw. Die Ideen wirken teils erst nach 10 oder 20 Jahren durchschlagend. Ich nannte Cerebras (riesige GPU auf 12-Zoll-Wafer); auch LPU gibt es in den USA. Um die Abhängigkeit von HBM zu reduzieren, wird in der GPU viel SRAM verbaut – rund 1000-mal schneller als DRAM, aber geringe Kapazität. Soweit ich weiß, hat selbst die Cerebras-Chip nur 44GB SRAM, ich halte 400 bis 440GB für sinnvoll.
Die Idee ist: Einen kompletten 12-Zoll-Wafer nur als SRAM bauen, das ganze zehn-, zwölf- oder sechzehnmal übereinanderstapeln, und so von 100 auf 1600GB erhöhen. Stellt man die GPU auf diese Stapel, ist sie 1000-mal schneller, hat aber auch genügend Kapazität. Das erscheint sehr stimmig – für diesen Chip nenne ich das HBS. Mein Traum ist: HBM, HBF, HBS werden gemeinsam zu 100-stöckigen Hochhäusern, die GPU thront zuoberst, das Kühlsystem ist integriert. Diese 3D-Halbleiterstruktur wird unausweichlich die Architektur zukünftiger KI-Computer bilden.
Das mag 10, 20 oder sogar 30 Jahre dauern. Die größte technische Hürde ist die Stromzufuhr: Auf HBS/HBM gestapelte GPUs benötigen viele tausend Ampère; das Design der Stromleitung wird das Kernproblem und macht die Technologieführerschaft aus. SK Hynix, Samsung, Micron und TSMC sind alle betroffen – und natürlich die Kühllösung. Die heutigen Diskussionen um Nanometerprozesse werden für solche 3D-KI-Computer in Zukunft vom Strom- und Kühlsystem abgelöst. Das entscheidet, wer überlebt.
Moderator: HBS ist also die „Hwang Jung-min“ der Speicherchips (Metapher für einen Star-Performer)?
Kim Jeong-ho: Stimmt, Hwang Jung-min passt. Als ich vor zehn Jahren hörte, dass Cerebras eine 12-Inch-Wafer-GPU baut, fragte ich: „Was soll das?“. Vielleicht militärisches KI. Ich war skeptisch – aber kürzlich ist die Firma an die Nasdaq gegangen, meine Meinung hat sich geändert. Der Ansatz ist sinnvoll, Schwachpunkt ist die fehlende Speicherkapazität – also stapeln wir auch SRAM. Neulich hatte ich morgens diese Idee, ließ meinen Studenten eine Skizze machen. Gerade beginnen wir mit HBF, die neuen Masterstudenten sollen HBS zum Forschungsschwerpunkt ihrer Abschlussarbeiten machen.
Moderator: Wer stellt SRAM her?
Kim Jeong-ho: Das fertigen Foundry-Unternehmen, sowohl TSMC als auch Samsung Electronics.
Moderator: Man sagt, die Betriebsgewinne von Samsung und SK Hynix könnten dieses Jahr 500-600 Billionen Won erreichen – ist das realistisch?
Kim Jeong-ho: Ich denke ja. Ich treffe mich häufig zu Fachgesprächen mit Führungskräften beider Konzerne, und sehe, wie sehr sie darauf brennen. Über Einnahmen sprechen sie mit mir zwar nicht. Ein wichtiger Punkt heute ist das „Customized HBM“. Früher fertigte man standardisierte Produkte in Masse, der Kunde entschied, wie viel er abnahm, Preisschwankungen, das war der berühmte Zyklus. Die Speicherkonzerne bestimmten nicht, sondern CPU- oder Computerhersteller kauften – wir mussten Pufferlager halten, war die Nachfrage schwach, hatten wir das Risiko. Das ist der „Speicherzyklus“.
Seit HBM4 aber – abgesehen davon, dass man GPU-Integration zuschaltet – gibt es nun auch Interkom-Funktion unter HBM: HBMs können sozusagen interne Kommunikation/Allokation machen, nicht nur stumpf GPU-Anweisungen abarbeiten. Künftig werden HBMs, die besser laufen, mehr Speicher zugewiesen, unterdurchschnittliche HBMs bekommen keine Daten für die GPU. Durch diese Algorithmik, Kommunikation und GPU-Funktion werden die HBMs für Google, AMD und NVIDIA explizit maßgeschneidert. Man schließt dazu langfristige Lieferverträge (LTA), ohne Auftrag beginnt man nicht mit der Entwicklung.
Aktuell wollen KI-Konzerne unbedingt leistungsfähiges HBM, stehen dafür Schlange, der Markt ist zum Verkäufermarkt geworden, Preise bestimmen die Anbieter. Das ist ein Paradigmenwechsel.
Moderator: Bis hierher haben wir mit Professor Kim Jeong-ho von KAIST über die Halbleiterindustrie gesprochen. Vielen Dank für Ihren heutigen Besuch.
Kim Jeong-ho: Danke ebenfalls.
Haftungsausschluss: Der Inhalt dieses Artikels gibt ausschließlich die Meinung des Autors wieder und repräsentiert nicht die Plattform in irgendeiner Form. Dieser Artikel ist nicht dazu gedacht, als Referenz für Investitionsentscheidungen zu dienen.
Das könnte Ihnen auch gefallen
Canada Goose (GOOS.US): Q1-Umsatz in Großchina steigt um 44,2 %, ganzjährige Strategie auf langfristiges Wachstum ausgerichtet
Im ersten Quartal des Geschäftsjahres 2027 stieg der weltweite Gesamtumsatz von Canada Goose im Vergleich zum Vorjahr um 10,3 % auf 118,9 Millionen kanadische Dollar.

Die Abwicklung der 1,6 Milliarden „blutigen Chips“ ist abgeschlossen: Citadel entschärft den KI-Absturzhype – bildet dies das Ende des Ausverkaufs oder den Beginn des Dominoprinzips?
Nachdem der Markt bestätigt hatte, dass keine ungeordnete Verkaufswelle aufgrund von Situational Awareness mehr erforderlich war, sank das Angebot der Verkäufer abrupt, während gleichzeitig Short-Covering und fundamentale Käufe einsetzten: Der KOSPI in Südkorea stieg rekordverdächtig um 17,9 %, Samsung Electronics und SK Hynix legten jeweils um etwa 28 % und 30 % zu, und der Philadelphia Semiconductor Index erholte sich ebenfalls stark.

Gold nähert sich dem oberen Bereich – wartet ein Ausbruch?

AI-Engine startet neu, europäische Aktien erreichen neue historische Höchststände! Der paneuropäische Stoxx 600 steuert auf den vierten Tagesgewinn in Folge zu
Angetrieben durch die starke Erholung der globalen Technologiewerte und die wieder auflebende Investitionsstimmung im Bereich Künstliche Intelligenz (AI), verzeichneten die europäischen Aktienmärkte am Freitag breite Kursgewinne. Der gesamteuropäische Stoxx 600-Index erreichte im Tagesverlauf ein Allzeithoch und steht kurz davor, den vierten Monat in Folge zuzulegen, womit ein ohnehin robuster Juli einen erfolgreichen Abschluss findet.

