Kimi K3 im Studio: das offene 2,8-Billionen-Modell liest Screenshots
Moonshot's Kimi K3 ist das erste offene 3-Billionen-Klasse-Modell mit 1M-Token-Context und nativer Vision die CAD nennt. Ein PAZ Hands-on für BIM-Desks.
Das Signal landete in einem Posteingang, nicht auf einer Keynote: Moonshot AIs Quickstart für Kimi K3, ein 2,8-Billionen-Parameter-Flaggschiff, das Team nennt es das weltweit erste Open-Source-Modell in der 3-Billionen-Klasse. Vollständige Weights datieren auf 27. Juli 2026. Im Marketing versteckt liegt die Zeile die einer BIM-Desk wirklich interessiert: K3 hat natives visuelles Verständnis und ist optimiert um „Workflows in Spielentwicklung, Frontend-Engineering, CAD und verwandten Szenarien zu verbessern.” Ein Frontier-Modell das CAD beim Namen nennt ist selten. Also folgen wir dem Weg und sehen was es mit einem Clash-Screenshot macht.
Das System hinter dem Signal verdient einen Absatz, weil es erklärt warum 2026 und nicht 2021. K3 läuft auf Kimi Delta Attention (KDA) — eine Hybrid-Linear-Attention-Variante — plus Attention Residuals, auf derselben Transformer-Linie auf der das Feld seit Vaswani’s 2017 Paper reitet. Linear Attention ist der Trick der das Context Window auf 1 Million Tokens streckt ohne die quadratische Memory-Rechnung die ältere Modelle kurz hielt. Darauf sitzt eine Stable LatentMoE die gerade 16 von 896 Experts pro Pass aktiviert; Moonshot behauptet ungefähr 2,5× die Scaling-Effizienz von K2, und notiert dass ihre Modelle die Open-Source-Skalierungs-Frontier in 9 von 12 Monaten von Juli 2025 bis Juli 2026 hielten. Übersetzung für den Site Engineer: ein grösseres Gehirn das über einen ganzen Tender-Ordner wach bleibt, nicht nur die Seite davor.
←HEUTE: Kimi K3 versendet offene Weights (27. Juli 2026), 1M-Token-Context, native Vision — und nennt CAD als Ziel-Workflow. →3012: Die Büros die lernten die Argumentation einer Maschine zu überprüfen, nicht nur ihre Ausgabe zu akzeptieren, produzierten zuverlässige Bauten; der Rest produzierte überzeugten Unsinn schneller. Drehpunkt: Offene Weights bedeuten dass das Modell seinen eigenen Vendor überlebt — die eine Eigenschaft die entscheidet ob dein 2026-Workflow 2051 noch öffnbar ist.
Das Werkzeug: Kimi K3, von Moonshot AI, erreichbar auf zwei Wegen. Du kannst es durch die gehostete API auf platform.kimi.ai ansprechen mit dem Standard OpenAI SDK — der schnelle Weg für einen Architekten der heute Nachmittag eine Antwort will. Oder, weil die Weights offen sind, kannst du es auf deiner eigenen Hardware laufen lassen: AWS veröffentlichte eine Anleitung zum Deployen von Kimi K3 auf SageMaker HyperPod und EKS, und DeepInfra’s Modell-Analyse vergleicht Third-Party API-Provider wenn du lieber GPUs mieten als besitzen willst. Für ein Kleinbüro ist die API der ehrliche Startpunkt; ein 2,8T-Modell schläft nicht unter deinem Tisch.
Einrichtung: die Beispiele brauchen Python 3.9+ und das OpenAI SDK. Das Flaggschiff wird nach einem Minimum von $1 Aufladung freigeschaltet — das ist die Barriere, nicht ein Abonnement.
python -m venv .venv && source .venv/bin/activate # Windows: .venvScriptsactivate
pip install "openai>=1.0"
from openai import OpenAI
client = OpenAI(api_key="sk-...", base_url="https://api.moonshot.ai/v1")
r = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "In one line: what is IFC?"}])
print(r.choices[0].message.content) # proves the key, the model, the pipe
Erste Schritte:
- Lade das Minimum von $1 auf platform.kimi.ai um das Flaggschiff freizuschalten, dann füge den Schlüssel in den obigen Client ein und führe ihn aus. Wenn IFC zurückkommt, funktioniert dein Setup.
- Beachte dass K3 immer reasoning — Thinking Mode ist standardmässig an. Wähle die Kosten mit dem Top-Level
reasoning_effortFeld:lowfür einen schnellen Entwurf,max(der Standard) für die knifflige Tender-Klausel. Dieser eine Drehschalter ist dein Speed-/Spend-Hebel. - Frage es als nächstes nach einer Codebase-Frage: weise es auf einen Ordner deiner Grasshopper Python oder IfcOpenShell Scripts hin und lass das 1M-Token-Fenster das Ganze lesen bevor es antwortet. Hier verdient sich Long-Horizon-Coding seinen Namen.
Atelier: Das Büro das schon einen AI-Copilot-Zyklus durchgemacht hat, kennt die Kosten — der Nachmittag verloren in einer Dialog-Box, die plausible Antwort die still falsch war. PAZ hat diesen Faden schon behandelt: Februar und April 2026 brachten Ant und Raven, zwei CAD-native Copiloten die deine echte Grasshopper-Datei lesen statt einer Beschreibung davon. K3 ist die Schicht darunter — die rohe Reasoning-Engine die du in deine eigenen Tools verdrahten kannst. Dein Montag-Zug: gib $1 auf die API, füttere es mit einem echten Screenshot eines Clash den du bereits per Hand gelöst hast, und beurteile seine Lösung gegen deine. Ein ehrlicher Vergleich sagt dir mehr als jede Benchmark-Tabelle.
Hack: Gib K3 einen Screenshot des Clash und lass es die Lösung in Worten nennen. Vision-Input erwartet ein Base64-Array, keine URL — öffentliche Bild-Links werden abgelehnt — also encodieren wir das PNG inline und fragen nach genau einem Zug. Verwende den Client aus Einrichtung erneut.
import base64
img = base64.b64encode(open("clash_view.png", "rb").read()).decode()
msg = [{"type": "text", "text": "Which duct clashes the beam? One fix."},
{"type": "image_url", "image_url": {"url": f"data:image/png;base64,{img}"}}]
print(client.chat.completions.create(model="kimi-k3", reasoning_effort="high", messages=[{"role": "user", "content": msg}]).choices[0].message.content)
Ersetze den Prompt durch „lese die Nord-Elevations-Dimensionen” oder „welche Räume haben kein Tageslicht” und du hast ein zweites Paar Augen auf dem Render bevor der Maurer den Fehler findet.
Der Trade-Off ist klar, und es ist eine Eigenschaft der Maschine, nicht ein Mangel seitens der Leute die sie gebaut haben: K3 fixiert temperature=1.0 und top_p=0.95, begrenzt max_completion_tokens auf einen Standard von 131.072 (einstellbar bis 1.048.576), und Moonshot kennzeichnet dass Web-Suche überarbeitet wird und noch nicht für Production empfohlen wird. Du bekommst einen starken Reasoner mit ein paar arretierten Drehschaltern, nicht ein konfigurierbares Orakel. Rechne das ein bevor du einen Termin davon abhängig machst.
Hier ist der Teil den meine Generation auf die harte Tour gelernt hat. Die Bauten die schlecht alterten waren nie die hässlichen — sie waren die die niemand wiederöffnen konnte nachdem ein proprietäres Format verschwand. Eine gehostete API kann auf einer Preismitteilung verschwinden. Offene Weights können nicht unreleased werden. Die Weights überleben die Rechnung — eine seltene Eigenschaft. Also verwende die API für Geschwindigkeit heute, aber behalte die Juli-2026-Weights und das AWS-Deploy-Rezept in deinem Archiv. Das ist der Unterschied zwischen Intelligence mieten und eine Kopie besitzen die ein 25-Jähriger 2051 noch starten kann. Der Zug jetzt: führe den Basic Call aus, führe die Vision Hack einmal aus, und notiere welcher Aufruf falsch war.
Learn-it:
- Quickstart / Docs: platform.kimi.ai — Kimi K3 Quickstart
- Selbst-Hosting-Anleitung: Kimi K3 auf AWS deployen (SageMaker HyperPod + EKS)
- Lokal laufen lassen: Kimi K3 lokal laufen lassen — der einfache Leitfaden
- Provider-Vergleich: DeepInfra — Kimi K3 Modell-Analyse & API-Provider
- BIM-Integration zum Verdrahten: IfcOpenShell — das offene IFC-Toolkit
Quellen & Weiterführende Literatur
- Primär: platform.kimi.ai — Kimi K3 Quickstart
- Vertiefend: Kimi K3 auf AWS deployen
QUELLE · ↗
PAZ Kaffi · interdisziplinäre Redaktionsarbeit, geleitet von der PAZ Academy