惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Y
Y Combinator Blog
IT之家
IT之家
博客园_首页
量子位
博客园 - 三生石上(FineUI控件)
小众软件
小众软件
博客园 - 聂微东
罗磊的独立博客
酷 壳 – CoolShell
酷 壳 – CoolShell
Hugging Face - Blog
Hugging Face - Blog
V
V2EX
爱范儿
爱范儿
大猫的无限游戏
大猫的无限游戏
宝玉的分享
宝玉的分享
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
雷峰网
雷峰网
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Google DeepMind News
Google DeepMind News
Microsoft Azure Blog
Microsoft Azure Blog
有赞技术团队
有赞技术团队
S
SegmentFault 最新的问题
Engineering at Meta
Engineering at Meta
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com

heise online News

Machine Learning mit Python – KI und Deep Learning in 5 Sessions erklärt Porsche-Chef Leiters plant umfassenden Konzernumbau Studie: KI bleibt oft im Testlauf stecken iX-Workshop: Grundlagen und Prinzipien eines modernen IT-Managements Missing Link: Aus für De-Mail – warum das „@“ das eingekringelte „e“ besiegte Top 10: Android Auto & Carplay nachrüsten – das beste Display fürs Auto im Test BOS-Funk: ETSI standardisiert Funk für Behörden Repair-Cafés jubeln: Bundestag beschließt Ökodesign-Reform für Nachhaltigkeit Google wehrt sich gegen Monopol-Urteil CERN-Rat beschließt Strategie-Update: FCC-ee soll LHC-Nachfolger werden Product Owner AI Day 2026: Konferenz und Workshop für KI im Produktmanagement Taskforce sieht keine Knappheit bei Kerosin Aus dem Weg! E-Scooter Navee UT5 Max mit Kuhfänger und brachialer Power im Test Krankenhaus-IT: Geldmangel und schlechte Prozesse gefährden Digitalisierung „The Boroughs“: Opa entdeckt Stranger Things iX-Workshop: Lokales Active Directory gegen Angriffe absichern Google Pics und Tiger-Selfies – die Fotonews der Woche 21/2025 Fitbit-App bekommt großes Update auf Version 5.0 und heißt jetzt Google Health Zwischen Wellen, Weite und Wissenschaft: Die Bilder der Woche 21 Sonnenenergie effizient speichern und nutzen | c’t uplink Cyberangriff auf Abrechnungsdienstleister betrifft viele Kliniken Lizenzstreit und Cloud-Zwang: Bambu Lab unter massivem Druck Vom Postweg ins BundID-Konto: Bundestag stimmt für digitales Führungszeugnis Windows 11 ist ein kompletter Verkehrsunfall Europol legt VPN-Dienst lahm TV-Deals zur WM: Die besten Fernseher von OLED bis XXL zum Tiefstpreis Nvidia will mit Vera-Prozessoren nach der CPU-Krone greifen Googles XR-Brillen auf der I/O: Project Aura & Prototyp ausprobiert Proxmox VE 9.2 mit Dynamic Load Balancer und Linux Kernel 7.0 Großstadt blockiert Überwachungssoftware Palantir
Effiziente KI: Wie neue Modelle die Token-Kosten und RAM-...
Andrea Trinkwalder · 2026-06-26 · via heise online News

Die experimentellen Chatbots von einst entwickeln sich zu mächtigen KI-Agenten, mit schier unermesslichem Ressourcenbedarf und -verbrauch: mehr Trainingsdaten, mehr Grafikkarten, mehr RAM, mehr Tokens. Die Rechnung zahlt der Kunde, denn abgerechnet wird mittlerweile nach Tokenverbrauch. Und auch der Rest der Welt leidet unter der Knappheit wichtiger Komponenten und steigenden Preisen – nebst drohenden Verteilungskämpfen um Wasser und Elektrizität. Doch dass generative KI so enorm viel Rechenleistung benötigt, ist kein Naturgesetz. Vielmehr liegt es am zentralen Baustein der Sprachmodellarchitektur: dem Aufmerksamkeits- beziehungsweise Attention-Mechanismus.

Dieses äußerst rechenintensive Verfahren ist nicht nur hauptverantwortlich für den immensen Energiehunger von generativer KI, sondern bildet mittlerweile auch einen spürbaren Engpass, gegen den selbst die Nvidias dieser Welt mit all ihren Grafikkarten nur schwer ankommen. Der eingesetzte Attention-Mechanismus begrenzt die mögliche Kontextlänge – also die Menge an Inhalten, die ein Sprachmodell bei einer Aufgabe verarbeiten kann.

  • Moderne Sprachmodelle basieren fast durchweg auf Transformer-Architekturen, deren Attention-Mechanismus enorme Rechenressourcen benötigt.
  • Entwickler von alternativen Ansätzen wie xLSTM und Kimi Linear versuchen, den Aufwand zu reduzieren, indem sie ein effizienteres Gedächtnis konstruieren.
  • Sie könnten sich zunächst dort etablieren, wo Rechenleistung knapp ist: in der Industrie und der Robotik.

Die Etablierten wie OpenAI & Co. ziehen sich mit Rechentricks aus der Affäre, während Start-ups und Forscher nach verbesserten oder alternativen Architekturen suchen – mit Erfolg: Die einst in Siri und Alexa verwendeten, aber für umfangreiche Texte ungeeigneten Long-Short-Term-Memory-Netze (LSTMs) feiern in einer modernisierten Extended-Version namens xLSTM ein Comeback. Auf dessen unter Leitung von KI-Pionier Sepp Hochreiter entwickelten, effizienten Gedächtnisfunktionen baut auch die Transformer-Variante Kimi Linear aus den Laboren des chinesischen Start-ups Moonshot AI auf. Beide Modellformen verringern den Rechenaufwand im Vergleich zum ursprünglichen Aufmerksamkeitsalgorithmus drastisch. Wir erklären, wie ihnen das gelingt – und ob die Tage des mit Milliarden an Investorengeldern gepushten Transformers deshalb gezählt sind.

Das war die Leseprobe unseres heise-Plus-Artikels "Effiziente KI: Wie neue Modelle die Token-Kosten und RAM-Preise senken könnten". Mit einem heise-Plus-Abo können Sie den ganzen Artikel lesen.