惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
S
SegmentFault 最新的问题
N
Netflix TechBlog - Medium
Vercel News
Vercel News
F
Fortinet All Blogs
量子位
博客园 - Franky
酷 壳 – CoolShell
酷 壳 – CoolShell
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
MongoDB | Blog
MongoDB | Blog
Y
Y Combinator Blog
GbyAI
GbyAI
博客园 - 三生石上(FineUI控件)
Apple Machine Learning Research
Apple Machine Learning Research
爱范儿
爱范儿
月光博客
月光博客
Recent Announcements
Recent Announcements
人人都是产品经理
人人都是产品经理
Hugging Face - Blog
Hugging Face - Blog
D
DataBreaches.Net
H
Help Net Security
阮一峰的网络日志
阮一峰的网络日志
D
Docker
WordPress大学
WordPress大学

heise online News

Machine Learning mit Python – KI und Deep Learning in 5 Sessions erklärt Porsche-Chef Leiters plant umfassenden Konzernumbau Studie: KI bleibt oft im Testlauf stecken iX-Workshop: Grundlagen und Prinzipien eines modernen IT-Managements Missing Link: Aus für De-Mail – warum das „@“ das eingekringelte „e“ besiegte Top 10: Android Auto & Carplay nachrüsten – das beste Display fürs Auto im Test BOS-Funk: ETSI standardisiert Funk für Behörden Repair-Cafés jubeln: Bundestag beschließt Ökodesign-Reform für Nachhaltigkeit Google wehrt sich gegen Monopol-Urteil CERN-Rat beschließt Strategie-Update: FCC-ee soll LHC-Nachfolger werden Product Owner AI Day 2026: Konferenz und Workshop für KI im Produktmanagement Taskforce sieht keine Knappheit bei Kerosin Aus dem Weg! E-Scooter Navee UT5 Max mit Kuhfänger und brachialer Power im Test Krankenhaus-IT: Geldmangel und schlechte Prozesse gefährden Digitalisierung „The Boroughs“: Opa entdeckt Stranger Things iX-Workshop: Lokales Active Directory gegen Angriffe absichern Google Pics und Tiger-Selfies – die Fotonews der Woche 21/2025 Fitbit-App bekommt großes Update auf Version 5.0 und heißt jetzt Google Health Zwischen Wellen, Weite und Wissenschaft: Die Bilder der Woche 21 Sonnenenergie effizient speichern und nutzen | c’t uplink Cyberangriff auf Abrechnungsdienstleister betrifft viele Kliniken Lizenzstreit und Cloud-Zwang: Bambu Lab unter massivem Druck Vom Postweg ins BundID-Konto: Bundestag stimmt für digitales Führungszeugnis Windows 11 ist ein kompletter Verkehrsunfall Europol legt VPN-Dienst lahm TV-Deals zur WM: Die besten Fernseher von OLED bis XXL zum Tiefstpreis Nvidia will mit Vera-Prozessoren nach der CPU-Krone greifen Googles XR-Brillen auf der I/O: Project Aura & Prototyp ausprobiert Proxmox VE 9.2 mit Dynamic Load Balancer und Linux Kernel 7.0 Großstadt blockiert Überwachungssoftware Palantir
Testen im Zeitalter der LLMs: Ein probabilistischer Ansat...
Mike Mannion · 2026-05-20 · via heise online News

Deterministische Assertions treffen auf nichtdeterministische Realität – und CI wird zum Würfelspiel: API-Latenz, Netzfehler, LLM-Variabilität.

Science,Research,As,A,Concept,For,Presentation, EHDS, eHealth, Gesundheitsdaten

(Bild: foxaon1987/Shutterstock.com)

Lesezeit: 13 Min.

Sobald Sie ein Large Language Model (LLM) in den Kontrollfluss Ihrer Anwendung integrieren, rufen Sie keine deterministische Funktion mehr auf – Sie ziehen Stichproben aus einem Modell. Das Modell kann in den meisten Fällen korrekt sein und dennoch gelegentlich fehlerhaften Output liefern: mal formal ungültig, mal semantisch daneben oder zwar schema-konform, aber für Ihre Anwendung nicht sicher brauchbar.

Deterministische Assertions treffen auf nichtdeterministische Realität – und CI wird zum Würfelspiel: API-Latenz, Netzfehler, LLM-Variabilität. PUnit macht aus Unit-Tests statistische Prüfungen: Statt „ein Output ist korrekt“ wird geprüft, ob die Pass-Rate eine Mindestqualität mit definierter Konfidenz erreicht. Ergebnis: entscheidungsfähige Tests für stochastische Systeme – also „grün“ wird wieder vertrauenswürdig.

Ein konkretes Beispiel: Ein Assistent soll eine Kundenanfrage in einen Befehl übersetzen, der als JSON ausgedrückt wird. Der Happy Path ist trivial, doch drei Fehlerklassen tauchen in der Praxis immer wieder auf:

  • strukturell ungültiger Output (zum Beispiel ungültiges JSON),
  • valider Output mit falscher Semantik (zum Beispiel eine nicht unterstützte Aktion),
  • valider Output, der von einem strikten Schema in einer Weise abweicht, die nachgelagerte Logik bricht (zum Beispiel umbenannte Felder oder unerwartete Werte).

Mike Mannion ist Senior Software Engineer und Berater mit über 35 Jahren beruflicher Erfahrung in der Entwicklung von Unternehmenssoftware. Sein Schwerpunkt liegt auf skalierbaren Java-Lösungen, der Integration von KI und ML sowie auf Data-Warehousing- und Business-Intelligence-Systemen. Er verbindet tiefgehende technische Expertise mit pragmatischem Engineering und legt besonderen Wert auf robuste, skalierbare Architekturen, Qualitätssicherung und belastbare Teststrategien.

Das folgende Listing zeigt eine vereinfachte Happy-Path-Interaktion.

Das war die Leseprobe unseres heise-Plus-Artikels "Testen im Zeitalter der LLMs: Ein probabilistischer Ansatz gegen flakige Tests". Mit einem heise-Plus-Abo können Sie den ganzen Artikel lesen.