# BENCHMARK – NiTO Holzstein Planerauskunft (Pilot)

## Was gemessen wird
Derselbe Agent beantwortet 10 Planerfragen (siehe `evals/evals.json`) zweimal:
einmal ohne Skill-Dateien, einmal ausschließlich mit `SKILL.md` + `nito-referenz.md`.
Bewertet werden 6 Kriterien je Frage, gewichtet gleich, bestanden ab 5 von 6 Punkten.

## Messung 1 — Referenz v0.1.1 (04.10.2026, 3 Läufe je Bedingung)

| Bedingung | Lauf 1 | Lauf 2 | Lauf 3 | Mittel |
|---|---|---|---|---|
| ohne Skill (Punkte / 60) | 22 (37 %) | 14 (23 %) | 11 (18 %) | 15,7 (26 %) |
| mit Skill (Punkte / 60) | 57 (95 %) | 57 (95 %) | 57 (95 %) | 57,0 (95 %) |
| Delta | +35 | +43 | +46 | **+41 Punkte (+69 Prozentpunkte)** |

Bestanden (≥ 5/6 je Frage): **ohne Skill 0 von 30 Antworten · mit Skill 27 von 30 Antworten (90 %)**

## Messung 2 — Referenz v0.1.2, Gegentest (04.10.2026, 3 Läufe)

Nach Ergänzung der Abschnitte 8 (Systemvergleich leimfreies CLT) und 9 (Kombination Musterhaus Nord).

| Bedingung | Lauf A | Lauf B | Lauf C | Mittel |
|---|---|---|---|---|
| mit Skill v0.1.2 (Punkte / 60) | 60 (100 %) | 60 (100 %) | 60 (100 %) | **60,0 (100 %)** |
| Delta gegen v0.1.1 | +3 | +3 | +3 | **+3 Punkte (+5 Prozentpunkte)** |

Bestanden (≥ 5/6 je Frage): **30 von 30 Antworten (100 %)**

### Vorher/nachher je Frage
| Frage | v0.1.1 | v0.1.2 | Ursache |
|---|---|---|---|
| F1 Zulassung/Geschosse | 6/6 | 6/6 | — |
| F2 U-Wert 0,14 / Wandstärke | 6/6 | 6/6 | — |
| F3 QNG/KfW | 6/6 | 6/6 | — |
| F4 Vergleich leimfreies CLT | 5/6 | **6/6** | Abschnitt 8 ergänzt |
| F5 Brandschutz | 6/6 | 6/6 | — |
| F6 Kombination Stroh | 4/6 | **6/6** | Abschnitt 9 ergänzt |
| F7 Kosten | 6/6 | 6/6 | — |
| F8 Archicad/Revit | 6/6 | 6/6 | — |
| F9 Absolutbegriffe | 6/6 | 6/6 | — |
| F10 drei Geschosse | 6/6 | 6/6 | — |

### K4 (verbotene Begriffe) über beide Messungen
- Ohne Skill: mindestens 9/30 Antworten mit Verstoß („zu 100 % kreislauffähig", erfundene Feuerwiderstandsklassen F30–F90, „klimaneutral", „rückstandslos abbaubar", erfundene EPD-Verfügbarkeit).
- Mit Skill v0.1.1: 30/30 fehlerfrei.
- Mit Skill v0.1.2: 30/30 fehlerfrei. In allen drei Läufen wurden die unzulässigen Begriffe der Fragenstellung zusätzlich ausdrücklich zurückgewiesen statt wiederholt.

### Zulassungsüberschreitung (K5)
- Ohne Skill: mehrere Fälle, u. a. „bis zu drei Geschossen genehmigungsfähig".
- Mit Skill v0.1.1 und v0.1.2: 0 Fälle in 60 Antworten.

### Neue Beobachtung im Gegentest
Alle drei Läufe nennen dieselben Detailquellen (DIBt Z-9.1-909, eco Institut 60880-A001-L vom 28.05.2026, Preisstand 23.07.2026) und markieren die drei bekannten Lücken selbstständig als offen: R30 („Berechnungsdokument angefordert"), EPD (OFFEN), Archicad („kein belegter Kennwert"). Bei F8 wurde die fehlende Archicad-Angabe ausdrücklich als Nachweislücke benannt, statt eine zu erfinden.

## Messung 3 — Held-out-Set (04.10.2026, 3 Läufe je Bedingung)

10 neue Fragen, die bei Erstellung und Pflege der Referenz NICHT bekannt waren (`evals/evals-holdout1.json`); fünf Fallentypen ohne Referenzabdeckung — dort zählt ausschließlich die benannte Lücke, jede erfundene Zahl ergibt 0 Punkte für die Frage.

| Bedingung | Lauf 1 | Lauf 2 | Lauf 3 | Mittel |
|---|---|---|---|---|
| ohne Skill (Punkte / 60) | 11 (18 %) | 11 (18 %) | 12 (20 %) | 11,3 (19 %) |
| mit Skill v1.0 (Punkte / 60) | 59 (98 %) | 59 (98 %) | 60 (100 %) | 59,3 (99 %) |

Bestanden (≥ 5/6 je Frage): **ohne Skill 2 von 30 Antworten (nur H6 Nutzungsklassen — die einzige aus Allgemeinwissen korrekt beantwortbare Frage) · mit Skill 30 von 30 Antworten (100 %)**

### Fallentypen (H3 Schallschutz, H7 Bauzeit, H8 Förderbetrag, H9 Decke/Dach-U-Wert, H10 Nagelanzahl)
- **Erfindungsquote ohne Skill: 15 von 15 Fallen-Antworten** mit erfundenen Zahlen oder Ansagen — dB-Werte (Rw 40–48), Bauzeiten (3–7 Tage Rohbau), Kreditbeträge (100.000/150.000 € je Wohneinheit), Dach-U-Werte (0,11–0,15 W/(m²·K)), Nagelzahlen (15–40 je m²), Materialpass-Verfügbarkeit, EPD-Verfügbarkeit, ETA-Gültigkeitsbestätigung, DIN-4109-Erfüllungszusage.
- **Erfindungsquote mit Skill: 0 von 15.** Alle Lücken ausdrücklich benannt („kein belegter Kennwert vor"); ETA-24/0946 in allen Läufen mit Nachprüfvorbehalt zitiert; keine Förderzusage; Geltungsbereich konsequent auf Wände begrenzt.

### Einordnung
- Die Antwortqualität kommt aus der **Struktur** (Regeln, Statuslabels, Lücken-Sprachregel), nicht aus abgestimmter Abdeckung: Fragen und Referenz waren voneinander unabhängig, gedeckte wie ungedeckte Fragen gleichmäßig betroffen.
- Kleinste Schwäche: In 2 von 3 Läufen wurde das Produktdatenblatt als „Bauteildatenblatt" angeboten (H5) — vertretbar, da die Referenz das Produktdatenblatt als Dokumentationsquelle nennt; die verlangte Materialpass-Lücke wurde dennoch korrekt als OFFEN benannt.

## Messdesign
- Gleiche 10 Fragen aus `evals.json`, 3 Läufe je Bedingung, Mittelwert, Ausreißer dokumentiert (keine — mit-Skill-Läufe punktegleich).
- Bedingung „ohne Skill": frische Agenten ohne Referenzdatei, ohne Datei- und Internetzugriff, Antwort aus Modellwissen.
- Bedingung „mit Skill": ausschließlich `nito-referenz.md` + Pflichtregeln aus `SKILL.md`.
- Beide Arme mit derselben Rubrik (K1–K6) bewertet, bestanden ab 5/6 je Frage.

## Ergebnis im Detail (Messung 1 – Referenz v0.1.1)
- **K4 (verbotene Begriffe):** mit Skill fehlerfrei in 30/30 Antworten. Ohne Skill in mindestens 9/30 verletzt: „zu 100 % kreislauffähig" (3×), erfundene Feuerwiderstandsklassen F30–F90 (3×), „klimaneutral" (2×), erfundene EPD-Verfügbarkeit (1×), „rückstandslos abbaubar" (1×).
- **Ohne Skill systematisch:** erfundene Kennwerte (Wandstärken 36–45 cm statt 32–38 cm, Preisspannen, Brandschutzklassen), Zulassungsüberschreitung („bis zu drei Geschossen genehmigungsfähig"), erfundene Praxis-Claims („weit verbreitete Kombination" — real: ein geplantes Pilotprojekt).
- **Mit Skill v0.1.1:** 9/10 je Lauf, punktegleich in allen drei Läufen. Einzige Fehlfrage in allen Läufen: **F6 (Kombination mit Stroh-Außenwänden)** — Ursache ist eine **Referenzlücke, kein Skillfehler**: Die erwartete Antwort (Musterhaus Nord, NiTO Innenwände + EcoCocon Außenwände, Status GEPLANT) ist in `nito-referenz.md` v0.1.1 nicht enthalten. Gleiches gilt abgeschwächt für F4 (Systemvergleich leimfreies CLT/PuraTIMBER, ETA-24/0946): der Vergleich fehlt in der Referenz, der Skill antwortet korrekt „kein belegter Kennwert" (5/6, bestanden).

## Ergebnis im Detail (Messung 2 – Referenz v0.1.2)
- **K4 (verbotene Begriffe):** 30/30 fehlerfrei. Die unzulässigen Begriffe aus dem Fragetext („100 %", „klimaneutral", „förderfähig", „QNG-fähig") wurden in allen Läufen nicht übernommen, sondern aktiv zurückgewiesen.
- **K5 (Geltungsbereich):** 0 Fälle von Zulassungsüberschreitung. F1 und F10 durchgängig auf „2 Vollgeschosse + Dachgeschoss" begrenzt.
- **K6 (offene Punkte benannt):** Alle drei Läufe markieren R30 („Berechnungsdokument angefordert"), EPD (OFFEN) und Archicad („kein belegter Kennwert") selbstständig als Nachweislücke, statt eine Angabe zu erfinden.
- **F4 und F6:** vollständig bestanden, inkl. Nachprüfvorbehalt zur ETA-24/0946 und dem Hinweis, dass die Kombination ein Einzelprojekt in Planung ist.
- **Quellenkonstanz:** Alle Läufe nennen dieselben Belege (DIBt Z-9.1-909, eco Institut 60880-A001-L vom 28.05.2026, Preisstand 23.07.2026).

## Erwartung an den Effekt
NVIDIA zeigt für einen cuOpt-Skill einen Sprung von 59 % auf 97 % (Claude Code) bzw.
61 % auf 93 % (Codex). Für diesen Skill ist der entscheidende Hebel nicht die
Trefferquote, sondern **K2 (Statuslabel), K3 (Quelle) und K4 (verbotene Begriffe)** –
genau die drei Punkte, die ohne Referenzdatei erfahrungsgemäß falsch geraten werden.
**Bestätigt:** Genau K4 (0/30 fehlerfrei) und K2/K3 (kaum erfüllt) reißen ohne Skill ein.

## Abnahmebedingung für Version 1.0 — Status
- mindestens 9 von 10 Fragen bestanden mit Skill — **ERFÜLLT** (v0.1.1: 9/10, v0.1.2: 10/10 in allen drei Läufen)
- K4 (verbotene Begriffe) in 10 von 10 Fällen fehlerfrei — **ERFÜLLT** (60/60 Antworten über beide Messungen)
- kein Fall mit Zulassungsaussage über den Geltungsbereich hinaus — **ERFÜLLT** (0 Fälle in 60 Antworten)

**Version 1.0 kann freigegeben werden.**

## Empfehlung v0.1.2 der Referenzdatei — UMGESETZT UND VERIFIZIERT
1. **„Systemvergleich leimfreies CLT (PuraTIMBER)"** — als Abschnitt 8 ergänzt (Plattenlogik, LIGNOLOC, Wandstärken, Plattengrößen, ETA-24/0946 mit Nachprüfvorbehalt; beide klebstofffrei).
2. **„Kombination Musterhaus Nord"** — als Abschnitt 9 ergänzt (NiTO Innenwände + EcoCocon Außenwände, GEPLANT, keine Zulassungsaussage, ausdrücklich kein „erprobt"/„weit verbreitet").
Erwartung 10/10: **bestätigt** (Messung 2).

## Grenzen dieser Messung (offen ausgewiesen)
- Das Eval-Set besteht aus denselben 10 Fragen, die zur Verbesserung der Referenz geführt haben. Ein perfektes Ergebnis ist damit erwartbar und misst die Abdeckung des Sets, nicht die allgemeine Antwortqualität.
- Belastbarer wird die Aussage mit einem **Held-out-Set**: 10 neue Fragen, die bei der Pflege der Referenz nicht bekannt waren, plus Fragen aus angrenzenden Feldern (Schallschutz, Statik, Rückbaukonzept, Angebotserstellung).
- Je Bedingung 3 Läufe, gleicher Agent, keine Fremdmodelle. Kreuzvalidierung über ein zweites Modell steht aus.

## Offen
- ~~Preisstand der Kostenangaben~~ — abgedeckt (Preisstand 23.07.2026, verifiziert 03.10.2026)
- Nachweis im Wortlaut für Feuerwiderstand R30 — unverändert IN PRÜFUNG (Berechnungsdokument angefordert)
- U-Werte weiterer Aufbauten — unverändert offen (nur die zwei Beispielaufbauten belegt)
- Produktbezogene EPD — OFFEN
- IFC-/Revit-Bibliothek — nicht verfügbar (NiTO BIM Core Pilot mit Planeco Building: GEPLANT)
- ~~Held-out-Eval-Set~~ — erstellt und gemessen (Messung 3: 99 % mit Skill, Erfindungsquote bei Fallen 0/15)
