Blog · Insights · Analysen

Aus dem Maschinenraum

Klartext zu KI, Sprachmodellen und Requirements Engineering – geschrieben von einer Ingenieurin aus der Automobilindustrie.

LOKALES SPRACHMODELL Das Modell interpretiert. Die Software entscheidet. Ein Schlüsseltresor mit einem vollständig lokal laufenden Sprachmodell — im Praxistest auf einem handelsüblichen Arbeitsplatzrechner, ohne Zugriff auf externe Dienste. Qwen3 14B · Q4_K_M ≈ 10 GB VRAM RTX 5060 Ti · 16 GB 8.192 Tokens kein Netzzugang DAS MODELL schlägt vor Natürliche Sprache verstehen Passendes Werkzeug auswählen Unscharfe Anfragen zuordnen Aber: kann Details erfinden und ähnliche Absichten verwechseln. Vorschlag DIE ANWENDUNG entscheidet Bestätigung vor jeder Schreibaktion Fehlertolerante Suche & Validierung Limits, Prüfungen, Verifikation Sensible Werte bleiben lokal — und außerhalb des Gesprächskontexts. Lokal bedeutet nicht automatisch sicher. 487 von 2.951 Codezeilen dienen der Verifikation — 51 Prüfungen laufen bei jedem Build.
Praxisbericht
27. August 202611 Min. Lesezeit

Was ein lokales Sprachmodell wirklich kann – und wo seine Grenzen liegen

Qwen3 14B auf einer handelsüblichen Grafikkarte: Was ein lokales Modell gut kann, wo es Details erfindet oder Absichten verwechselt – und warum die Schutzmechanismen in die Anwendung gehören, nicht ins Modell.

Lokales LLMQwen3 14BTool-Calling
Weiterlesen
DIE GROUNDING-LEITER Woher die Antworten stammen. Lückenlos belegt & nachvollziehbar. Der OSOS/Omega Regulation Check prüft System Requirements und Lastenhefte gegen die aktuellen UNECE-Regelungen. Die Analyse stützt sich hierarchisch auf verifizierte Quellen — von der verbindlichen Norm bis zur fundierten Orientierungshilfe. 1 Verbindlicher Normtext (Originalquelle) Konkrete Grenzwerte und Anforderungen stammen exakt aus den importierten Regelwerken — inklusive präziser Paragraphen- und Kapitelangabe. VERBINDLICH 2 OSOS-kuratierter Kontext Redaktionell hinterlegte Richtlinien und Erläuterungen — immer transparent als strukturierte Hilfe ausgewiesen. KURATIERT 3 Allgemeines Modellwissen Gut zur ersten Orientierung, kann aber je nach Stärke des verwendeten LLMs/Foundation Models variieren — und begründet daher niemals technische oder rechtliche Detailvorgaben. ORIENTIERUNG Freies Erfinden (Halluzination) Unbelegte Aussagen, frei assoziierte Grenzwerte oder erfundene Normen werden durch strikte System-Guardrails abgefangen — jede normative Aussage muss auf eine importierte Quelle zurückführbar sein. BLOCKIERT PRINZIP 01 Keine Spekulation. Fehlt ein Detail in den Daten, meldet das System klar: „Nicht im Regelwerk enthalten“ — statt eine erfundene Zahl zu nennen. PRINZIP 02 Vollständig transparent. Jede Anforderung ist direkt mit der exakten Textstelle im Originaldokument verknüpft und sofort verifizierbar. ! WARUM DAS BEI REGELUNGSTEXTEN ZÄHLT Ein plausibel klingender, aber erfundener Paragraph ist gefährlicher als gar keine Antwort — Verlässlichkeit ist unsere oberste Prämisse. OSOS/Omega Regulation Check — Grounding statt Halluzination.
Produkt
23. Juli 20268 Min. Lesezeit

KI-Antworten nachvollziehbar machen: Warum Quellenverweise im Regulation Check entscheidend sind

Grounding statt Halluzination: Der Regulation Check stützt seine Antworten hierarchisch auf verbindlichen Normtext, kuratierten Kontext und allgemeines Modellwissen – und macht sichtbar, wenn eine Angabe in den importierten Regelwerken schlicht nicht belegt ist.

GroundingRegulation CheckUNECE
Weiterlesen
Benchmark von fünf LLMs zur Identifikation von Konflikten mit UNECE-Klauseln Vergleich der LLM-Performance innerhalb von OSOS/Omega bei der UNECE-R48- Compliance-Validierung eines Scheinwerfer-Lastenhefts entdeckt (True Positive) False Positive verpasst — kritischer Fehler 0 5 10 je Modell: erkannt (grün) + verpasst (rot) = 13 Konflikte · orange = False Positive (Fehlalarm) GPT-5.5 13 Präzision 100 % Abdeckung 100 % ~$1,01 bester Gesamtwert Gemini 2.5 Flash 12 1 Präzision 100 % Abdeckung 92 % ~$0,33 Claude Opus 4.8 11 2 Präzision 100 % Abdeckung 85 % ~$1,53 teuerster Check Nemotron 3 Ultra 8 5 Präzision 100 % Abdeckung 62 % ~$0,10 günstigster (openrouter.ai) Mistral Large 3 5 8 1 Präzision 83 % Abdeckung 38 % ~$0,35 Aufgabenform schlägt Preisschild Fehlalarme spielten praktisch keine Rolle (nur Mistral: 1) — die Modelle differenzieren sich durch ihre Abdeckung. Nur GPT-5.5 findet alle 13; Opus (teuerster Check) gewinnt nicht, Nemotron (billigster) deckt nur 8 ab. Mistral ist mit nur 5 von 13 der deutliche Verlierer. UN-R48 Series 09 · 1.161 Klauseln, 13 harte Konflikte · je Anforderung ~150 vorgefiltert · Referenz: geprüfte Musterlösung.
Analyse
3. Juli 20266 Min. Lesezeit

Der Traum von der KI-Autonomie

Mit Nemotron 3 Ultra reicht erstmals ein offenes Modell spürbar nah an die Frontier-Klasse heran – und läuft komplett im eigenen Rechenzentrum. Was das für Datensouveränität, Kosten und kritische Reasoning-Aufgaben bedeutet, und wo die Lücke zur Cloud-Spitze bleibt.

Self-HostingDatensouveränitätNemotron 3 Ultra
Weiterlesen
Blog – OSOS/Omega | OSOS/Omega