CH NEO-ZÜRICH AUSGABE
WETTER · DUNST 19°C
BLEND DES TAGES · 07/ROGUE
EST. 2027
DIE AEC CYBER MORGENZEITUNG

PAZ Kaffi

DESIGN · ABBRUCH · KOFFEIN · DEPESCHE
AUSGABE 0802 · 2 August 2026
SENDUNG 04:42 MEZ
2'400 BOGEN GEDRUCKT
LESEZEIT · 47 MIN
Cache-Augmented Generation: das billigste Token liest man nie zweimal
KI
FRAME · 06:55
02-08-2026

Cache-Augmented Generation: das billigste Token liest man nie zweimal

Wie CAG einen stabilen Corpus cached und RAG-Kosten senkt – O(n²)-Engpass, Redis-TTL-Fallen und wann ein Schweizer BIM-Studio zugreifen sollte.

Jedes Retrieval-System entdeckt schliesslich eine Idee wieder, die Donald Michie 1968 aufschrieb. Er nannte sie eine Memo-Funktion: Wenn eine Berechnung eine reine Funktion ihrer Eingaben ist, führst du sie nie zweimal aus – speichere das Ergebnis unter einem Schlüssel aus den Argumenten, und der zweite Aufruf wird eine Suche, keine Berechnung. IBMs Entwicklungsteam veröffentlichte kürzlich einen klaren Primer zu Cache-Augmented Generation (CAG), der es als verbesserte Version von Retrieval-Augmented Generation (RAG) rahmt. Die Verpackung weggekratzt ist es Michies Memo-Funktion auf ein Sprachmodell angewendet: Die Token, die du nie erneut liest, sind die billigsten Token, die du je servierst.

Das ist strukturell zu verstehen, nicht nur operativ, denn Caching ist, wo die echten Kosten von AI 2026 liegen – wo ein Studio entweder Geld spart oder es still verliert.

Was es ist: CAG arbeitet auf zwei Ebenen, und es lohnt sich, beide zu sehen. Auf der flachen Ebene – die IBM beschreibt – legst du einen Key-Value-Store vor deinen Retrieval-Schritt. Eine Abfrage kommt an, du prüfst den Cache; bei einem Hit gibst du die gespeicherte Antwort zurück, bei einem Miss fragst du die externe Knowledge Base ab und schreibst das Ergebnis zurück. Auf der tieferen Ebene bedeutet CAG, einen festen Corpus direkt in den Aufmerksamkeitszustand des Modells vorab zu laden, sodass es zur Inferenzzeit keinen Retrieval-Schritt gibt. Beide folgen dem gleichen Instinkt in verschiedenen Tiefen: identifiziere den Teil der Arbeit, der sich zwischen Anfragen nicht ändert, berechne ihn einmal, und höre auf, dafür zu bezahlen.

Warum es funktioniert: Der Mechanismus beruht auf zwei Strukturen, die ein Computational Designer erkennt. Die erste ist die Kostenkurve der Aufmerksamkeit selbst. Wie unser PAZ-Konzeptpanel zur Transformer-Aufmerksamkeit es ausdrückt: Jedes Token beachtet jeden anderen Token in einer Matrixmultiplikation, und die Kosten sind O(n²·d) – quadratisch in der Sequenzlänge. Deshalb ist ein eingefrorenes, 40-seitiges BEP bei jeder Abfrage neu tokenisiert kein Rundungsfehler; es ist der dominante Term. Caching entfernt den konstanten, unveränderlichen Präfix aus dem Quadrat. Die zweite Struktur ist geometrisch, und hier verdient ein semantischer Cache seinen Namen. Ein Vector Store antwortet auf «welcher gespeicherte Schlüssel liegt diesem Query-Embedding am nächsten?» – und «welcher Punkt liegt dem Ort am nächsten» ist genau die Frage, die eine Voronoi-Tesselation beantwortet. Wie das PAZ-Voronoi-Panel vermerkt, dient ein Diagramm jedem Gewerbe, das Nearest-Neighbour-Zugehörigkeit entscheiden muss. Ein Cache-Hit ist einfach, innerhalb einer Voronoi-Zelle im Embedding-Raum zu landen, die du bereits beantwortet hast. Ein Miss bedeutet, du bist in eine leere Zelle gefallen und musst ihre Antwort berechnen, dann einen neuen Seed pflanzen.

Die harten Zahlen kommen von der Grenzfläche, nicht aus dem Primer. PAZ deckte diesen Thread ab, als DeepSeek V4 versendete – lies das Stück für den vollständigen Mechanismus, aber die tragende Zahl ist diese: Bei einem Kontext mit einer Million Token gab DeepSeeks V4-Pro (1,6 Billionen Parameter, 49 Milliarden aktiviert) an, rund 27 Prozent der Single-Token-Inferenz-FLOPs und nur 10 Prozent des Key-Value-Caches auszugeben, den sein V3.2-Vorgänger brauchte; gegen Grouped-Query-Attention in bfloat16 fiel der Cache-Speicherbedarf auf etwa 2 Prozent. Der Engpass bei längerem Kontext ist nicht die Berechnung, sondern die Bandbreite zwischen HBM und den Matmul-Engines, während der KV-Cache linear pro Schicht wächst. CAG und KV-Cache-Kompression greifen denselben Feind von entgegengesetzten Seiten an – einer vermeidet erneutes Lesen, der andere schrumpft das Gelesene.

←HEUTE: 2026 kann eine gecachte Antwort 12,5× weniger kosten als eine neu berechnete – die exakte Schreib-vs-Lese-Lücke ($3,75 vs $0,30 pro Million Token) hinter Anthropics März-Cache-TTL-Swing. →3012: Das Büro, das überlebt, speichert die Ableitung jeder gecachten Antwort, nicht die Cache-Datei, die sein Plugin nicht überleben wird. Drehpunkt: Ein Cache ist nur korrekt, solange seine Invalidierungsregel gilt – der Schlüssel, den du rekonstruieren kannst, ist mehr wert als der Wert, den du unter ihm speicherst.

Herkunft: Die Abstammung ist älter als die Language-Model-Ära und sauberer als das Marketing. László Bélády bewies die optimale Cache-Ersatz-Schranke bei IBM 1966 – den MIN-Algorithmus, demzufolge man den Eintrag entfernt, dessen nächste Benutzung am weitesten weg liegt – und jede echte Eviction-Policy seitdem ist eine Annäherung an diesen Orakel. Michies Memo-Funktionen folgten 1968. Die Production-Tools, die IBM empfiehlt, tragen ihre eigene Urheberschaft: Memcached wurde von Brad Fitzpatrick für LiveJournal 2003 gebaut; Redis wurde von Salvatore Sanfilippo 2009 geschrieben. RAG selbst ist ein 2020-Ergebnis – Patrick Lewis und Kollegen bei dem, was damals Facebook AI Research war, benannten das Muster. CAG ist nicht so sehr eine neue Erfindung als vielmehr der Moment, in dem Retrieval teuer genug wurde, dass Memoization zur interessanten Schicht wurde. Diese Abstammung zu benennen ist nicht Pedanterie; es ist, wie ein 25-Jähriger die Idee wieder aufbaut, wenn das aktuelle SDK dunkel wird.

In der Praxis: Ein Schweizer Büro sollte nach CAG greifen, sobald es das Stabile vom Live-Stoff trennen kann. Der SIA-Normtext, das IFC4-Schema, die eigenen BEP- und LOIN-Definitionen des Büros, der Standard-Ausschreibungs-Boilerplate – diese sind für Monate stabil. Das ist dein Cache-Corpus: lade es vor, schlüssel es, höre auf, es wieder zu berechnen. Die Live-Hälfte – dieses Projekts Ausschreibungs-Addenda, der aktuelle Clash-Report, gestrige Site-Minutes – bleibt auf klassischem RAG, denn es ändert sich und eine abgestandene gecachte Antwort dort ist ein Fehler, kein Sparen. Der Ausfallmodus, den IBM zuerst listet, ist der echte: Cache-Invalidierung. In einer hochdynamischen Umgebung serviert ein Cache stumm die LOIN von letzte Woche und niemand bemerkt es bis zu einem Coordination-Review.

Atelier: Für ein Büro, das dieses Jahr AI annimmt, ist die Aufteilung zwischen stabilem und Live-Kontext eine Governance-Entscheidung, nicht ein technisches Detail – wer den Cache besitzt, besitzt, welche Version der Norm das Modell zitiert. Dein nächster Schritt: audit einen AI-Workflow und markiere jedes Dokument, das es dem Modell zuführt, als entweder FROZEN (Normtext, Schema, BEP) oder LIVE (die sich ändernden Dateien dieses Projekts), dann cache nur die FROZEN-Gruppe mit einer expliziten Verfallszeit, die du bewusst wählst.

Hack: Hash die stabile Hälfte deines Prompts und lass den Cache vor dem Modell antworten. Die Invariante, die dies sicher macht, ist, dass der gespeicherte Wert eine reine Funktion eines stabilen Schlüssels ist – also baue den Schlüssel aus dem Kontext, nie aus der freien Textfrage, und setze die TTL selbst, statt dem Default zu vertrauen. Anthropics eigene Nutzer lernten diese Lektion auf teure Weise: Eine GitHub-dokumentierte Server-seitige Regression von einer Stunde zu einer fünfminütigen Cache-TTL um 6.–8. März 2026 führte zu einer gemessenen 949,08 USD-Überzahlung auf Sonnet über etwa 120.000 Calls. Wähle den Verfallszeitraum, der zu deinem tatsächlichen Normwechsel passt.

import redis, hashlib
r = redis.Redis()
key = "cag:" + hashlib.sha256(frozen_context.encode()).hexdigest()
if not (hit := r.get(key)):
    r.setex(key, 3600, hit := retrieve(frozen_context))  # 1h TTL, bewusst gewählt, nicht default

Die Zeile, die zählt, ist die dritte: Der Schlüssel ist der SHA-256 des stabilen Kontexts, sodass ein identisches BEP jedes Mal auf eine identische Zelle abbildet, und ein geändertes BEP bildet automatisch auf eine neue ab. Das ist die ganze Geometrie – eine deterministische Partition deiner Eingaben in Zellen, die du beantwortet hast, und Zellen, die du nicht beantwortet hast.

Behandle die Invalidierungsregel als das Lieferable, nicht den Cache. Eine gecachte Antwort, deren Schlüssel du nicht rekonstruieren kannst, ist genau die parametrische Geometrie ohne Ableitung: ein schönes Ergebnis, das du in der Überprüfung nicht verteidigen kannst. Schreib auf, neben jedem gecachten Corpus, die eine Bedingung, unter der er ablaufen muss – und stelle diese Regel heute unter Versionskontrolle, bevor der Corpus gross genug wird, dass niemand mehr erinnert, warum eine Antwort veraltet ist.

Quelle: developer.ibm.com

GEMELDET AUS
MIT-UNTERZEICHNER
PAZ Academy
VERTRAUEN
HIGH
NACHDRUCKE
© PAZ - PARAMETRIC ACADEMY ZURICH · ALLE RECHTE VORBEHALTEN

QUELLE ·

PAZ Kaffi · interdisziplinäre Redaktionsarbeit, geleitet von der PAZ Academy

⚑ FEHLER MELDEN · KORREKTUR EINSENDEN
◂ ZURÜCK ZUR TITELSEITE · PAZ KAFFI

© 2026 PAZ Academy.