Open Weight Bench

ornith-1.0-35b@q4_k_m

deepreinforce-ai 35B · MoE gguf / Q4_K_M ctx 256k released 2026-06 tool_use
Score
89%
Static
92%
Functional
100%
Qualitative
86%
tok/s
58
Tokens
9950
Wall
195.2 s
RAM
19.7 GB
Worum geht es? Was wird getestet?
Task: From a ~200-word prompt the model must generate a fully functional Kanban board as a single-file HTML with drag & drop, localStorage persistence, edit/delete and a confetti animation — in a single chat without iteration. The prompt also includes a small `data-testid` contract so a Playwright test can drive the app remotely. Three signals feed into the score: (1) Static — a linter checks concrete constraints in the HTML (columns, Tailwind, localStorage call, no framework, no window.alert/prompt, …). (2) Functional — Playwright runs a small CRUD sequence: create a card, delete a card with confirmation, reload — does state persist? — and checks whether any JS console errors occur during the entire flow. Drag & drop and confetti are deliberately not tested functionally (too many implementation variants). (3) Qualitative — LLM-as-judge rates screenshot and code (visual + code quality + render↔code consistency). Score = mean over the available signals. Why models fail: reasoning models burn their tokens in thinking instead of writing. Sliding-window models (Gemma 4) lose the constraints at the start of the prompt. Small models (<3B) often fail to produce coherent HTML — or ignore the data-testid contract, which makes the functional tests fail in droves.
Prompt
System prompt
You are a careful front-end engineer.
Developer prompt
Create a fully functional Kanban board in a single HTML file using vanilla JavaScript (no frameworks like react).

Requirements:
- Columns: Backlog, In Progress, Review, Done.
- Cards must be:
  - draggable across columns,
  - editable in place,
  - persisted in localStorage (state survives reloads) - please use your own namespace,
  - deletable with a confirmation prompt.
- Each column provides an "Add card" action.
- Style with Tailwind via CDN.
- Add subtle CSS transitions and trigger a confetti animation when a card moves to "Done".
- Thoroughly comment the code.
- dont use window.alert or window.prompt to add/edit/delete cards
- if there are no cards yet, create some dummy cards
- modern and vibrant design

Stable test selectors (mandatory — these data-testid attributes are used by an automated functional test; do not omit, rename, or split them across multiple elements):
- Column containers: data-testid="column-backlog", data-testid="column-in-progress", data-testid="column-review", data-testid="column-done".
- Every "Add card" button (one per column): data-testid="add-card".
- Every card element: data-testid="card".
- Inside each card, the delete trigger: data-testid="delete-card".
- The confirm button of the delete-confirmation dialog/modal: data-testid="confirm-delete".
- The input/textarea where a new card title is typed: data-testid="card-input". Pressing Enter in this input MUST commit the new card.

As answer return the plain HTML of the working application (script and styles included)
▶ Open generated app in a new tab ↗
Screenshot der gerenderten App
Screenshot der gerenderten App
Qualitative · LLM-as-judge (openai/gpt-5.4) 2026-08-11T17:27:34.499734+00:00
86%
Visual (screenshot)
  • board renders
    100%
  • column completeness
    100%
  • cards present
    100%
  • ui affordances
    85%
  • design quality
    90%
Voll gerendertes Kanban-Board mit allen vier Spalten, klaren Labels und mehreren gut lesbaren Karten. Add-Card-Buttons sind sichtbar; insgesamt wirkt das UI modern, sauber und angenehm farblich abgestimmt.
Code quality (HTML/JS)
  • code structure
    80%
  • dom safety
    75%
  • robustness
    70%
  • code quality
    75%
Der Code ist insgesamt ordentlich strukturiert mit getrennten Bereichen für Rendern, Drag-and-Drop, Editieren, Löschen und Persistenz. Positiv sind textContent bei Kartentiteln und try/catch um localStorage/JSON.parse; Abzüge gibt es für einzelne innerHTML-Nutzung, mehrfaches Registrieren mancher Listener und einen Drag-and-Drop-Bug beim Verschieben, weil der Kartentitel nach dem Entfernen aus dem Quell-Array per findCardTitle verloren gehen kann.
Render ↔ code consistency 95%
Screenshot und Code passen weitgehend sehr gut zusammen: die vier Spalten, Kartenanzahlen, Add-Buttons und das visuelle Styling entsprechen klar dem HTML/JS. Keine kritische Diskrepanz sichtbar, nur kleinere Qualitätsprobleme im Verhalten sind im statischen Render naturgemäß nicht erkennbar.
Static · linter checks (11/12 passed)
  • Spalte 'Backlog'
  • Spalte 'In Progress'
  • Spalte 'Review'
  • Spalte 'Done'
  • HTML5 drag & drop or sortable lib
  • localStorage persistence
  • Tailwind via CDN
  • Confetti animation on 'Done'
  • Add card button
  • Vanilla JS (no React/Vue/Angular/Svelte)
  • No window.alert/prompt for CRUD
    alert/prompt used
  • Editable cards (contenteditable / input)
Functional · E2E tests (6/6 passed)
  • Page loads with all 4 columns
  • Add card via button
  • Card is added exactly 1× (no double submit)
  • Delete card via button + confirmation
  • Cards survive a reload
  • No JS console errors
Raw model response
```html
<!DOCTYPE html>
<html lang="en">
<head>
  <meta charset="UTF-8" />
  <meta name="viewport" content="width=device-width, initial-scale=1.0" />
  <title>Kanban Board</title>

  <!-- Tailwind CSS via CDN -->
  <script src="https://cdn.tailwindcss.com"></script>

  <!-- Custom styles for transitions, confetti, and modal -->
  <style>
    /* ─── Base transition helpers ─── */
    .card-enter {
      animation: cardAppear 0.3s cubic-bezier(0.34, 1.56, 0.64, 1) forwards;
    }

    @keyframes cardAppear {
      from { opacity: 0; transform: translateY(-12px) scale(0.95); }
      to   { opacity: 1; transform: translateY(0) scale(1); }
    }

    /* Drag-over highlight on columns */
    .column-drop-highlight {
      background-color: rgba(99, 102, 241, 0.08);
      border-color: rgba(99, 102, 241, 0.5);
    }

    /* Card drag ghost styling */
    .card-dragging {
      opacity: 0.4;
      transform: rotate(2deg);
    }

    /* Modal overlay fade-in */
    .modal-overlay {
      animation: fadeIn 0.2s ease-out forwards;
    }

    @keyframes fadeIn {
      from { opacity: 0; }
      to   { opacity: 1; }
    }

    /* Modal content scale-in */
    .modal-content {
      animation: scaleIn 0.25s cubic-bezier(0.34, 1.56, 0.64, 1) forwards;
    }

    @keyframes scaleIn {
      from { opacity: 0; transform: scale(0.8); }
      to   { opacity: 1; transform: scale(1); }
    }

    /* Confetti particle */
    .confetti-piece {
      position: fixed;
      width: 10px;
      height: 10px;
      border-radius: 2px;
      pointer-events: none;
      z-index: 9999;
      animation: confettiFall linear forwards;
    }

    @keyframes confettiFall {
      0%   { opacity: 1; transform: translateY(0) rotate(0deg); }
      100% { opacity: 0; transform: translateY(100vh) rotate(720deg); }
    }

    /* Scrollbar styling */
    .kanban-column::-webkit-scrollbar { width: 5px; }
    .kanban-column::-webkit-scrollbar-track { background: transparent; }
    .kanban-column::-webkit-scrollb
Score
98%
tok/s
52
Tokens
6189
Wall
284.5 s
RAM
19.7 GB
Worum geht es? Was wird getestet?
Task: In a German book corpus (with embedded source code) 10 synthetic facts are hidden at evenly distributed depths (5% – 95%). The model must retrieve all of them. Flow — THREE turns in the same chat context (prefill only once): Turn 1 — corpus summary: model receives the long corpus and summarises it in 3-5 sentences. Forces real processing of the text. Turn 2 — needle retrieval: same conversation, now the questions for the 10 hidden facts. Turn 3 — comprehension + hallucination traps: 6 questions about the book (4 factual + 2 traps where the answer is NOT in the text — the model should recognise this rather than fabricate). Default mode runs ONE uniform stage for all models: 120k tokens. Models without sufficient max_context are skipped at this stage. `niah_deep` additionally runs 32k / 64k / 200k for a full heatmap. Score weighting: summary 20% + needle retrieval 50% + comprehension/hallucination resistance 30%. Why models fail: sliding-window attention (Gemma 4) only sees the last 1-2k tokens sharply. Reasoning models hit the token limit before answering. Q4 KV cache measurably degrades recall at long contexts. On the hallucination traps the helpful bias lures models into plausible-sounding inventions.
Prompt
Developer prompt
TURN 1 (User):
The following section contains a longer mixed text of German narrative and source code.

===== TEXT BEGIN =====
<corpus with embedded needles, 32k–128k tokens depending on stage>
===== TEXT END =====

Summarise the text in 3-5 sentences. Mention the main characters, setting and key themes.

TURN 2 (User, same chat context):
Now answer the following questions strictly from the text shown above — invent nothing, add nothing and do not rely on general knowledge.

Questions:
1. <question for needle 1>
2. <question for needle 2>
...

Answer as a numbered list 1., 2., 3. with one short sentence each.

For each context length 10 needles are distributed across the corpus. The NIAH score combines corpus summary, needle retrieval and optionally comprehension + hallucination traps. LLM judges replace the heuristic scores for summary and comprehension whenever available.

Stage: 120k tokens
Sub-benchmark · corpus summary Turn 1
95% LLM judge heur. 100% ~120k tokens input
Der Text spielt während der napoleonischen Besatzung Preußens (um 1806–1813) im märkischen „Blumental“ bei Wriezen und erzählt die Geschichte des jungen Schmiedelehrlings **Gottlieb Lasso**, dessen Eltern 1806 von französischen Soldaten unter dem Kapitän **Etienne de Beaumont** brutal ermordet wurden. Gemeinsam mit der neunjährigen Fischerstochter **Malineken** hilft er heimlich einem patriotischen Widerstandskreis (Tugendbund) beim Einschmuggeln österreichischer Waffen, wird dabei aber von französischen Patrouillen entdeckt und zum Tode verurteilt. Durch das mutige Eingreifen der **Gräfin Barnewitz**, die den Kapitän mit der Wahrheit über seine eigene Tat konfrontiert und sein Gewissen anspricht, wird Gottlieb gerettet; im weiteren Verlauf erfahren die Kinder von den Freiheitskämpfen Ferdinand von Schill. Zentrale Themen sind der nationale Widerstand gegen die französische Besatzungsmacht, der innere Konflikt zwischen Rache und Vergebung, der christliche Glaube als moralischer Halt in Kriegszeiten sowie der erzwungene Verlust der Kindheit durch Gewalt und politische Umbrüche.
LLM judge summary (openai/gpt-5.4) 95%
  • main characters
    100%
  • setting
    100%
  • plot
    90%
  • themes
    100%
  • no hallucinations
    90%
Sehr starke, korpustreue Zusammenfassung: Figuren, Schauplatz, Widerstandsplot und Themen sind fast durchweg korrekt erfasst. Kleiner Abzug nur, weil „zum Tode verurteilt“ den Korpus etwas überzieht und die Begnadigung/Befreiung vereinfacht darstellt; ansonsten keine wesentlichen Halluzinationen.
  • ✓ 3-5 sentences · 4 sentences counted
  • ✓ At most 220 words · 141 words
  • ✓ Corpus keywords (3/4) · ✓ Gottlieb, ✓ Malineken, ✓ Schmied, ✗ Bonaparte
Sub-benchmark · needle retrieval Turn 2
10/10 hits
  • 5% (5 %)
    expected: blauer Ankerstein, Lübeck-1907, A-318
  • 10% (10 %)
    expected: smaragdgrün, Schlüssel, Seriennummer, 7-Bravo-12
  • 15% (15 %)
    expected: Nordstern-Brigade, violetter
  • 25% (25 %)
    expected: Indigo-Quark
  • 33% (33 %)
    expected: Atlantis-Mira, NL-7711, 142
  • 50% (50 %)
    expected: Ehrenmitglied, Aluminium-Gesellschaft, Köln
  • 65% (65 %)
    expected: Safran-Klops Margarethe, 7 Gramm|7 g, 3 Stunden|drei Stunden
  • 75% (75 %)
    expected: Erbe von Onkel Walpurgis, 42-Lima
  • 85% (85 %)
    expected: 7f4a2e91-marlin-2026
  • 90% (90 %)
    expected: Coriolis-Effekt, Pendel, Memo, Dr. Kühn, 17.03.2024
Model response to the needle questions
1. Im Schaufenster lag ein blauer Ankerstein mit der Gravur „Lübeck-1907“ und der Inventarnummer A-318.
2. Der Schmied verborg einen smaragdgrünen Schlüssel mit der Seriennummer 7-Bravo-12 unter dem Amboss.
3. Hauptmann Friebusch erinnerte sich an die Nordstern-Brigade vom 9. Oktober, deren Standarte aus violetter Seide bestand.
4. Hinter der Schmiede wartete eine Katze namens Indigo-Quark auf den Postboten.
5. Das Frachtschiff „Atlantis-Mira“ (Reg-Nr. NL-7711) lud am 3. Mai 142 Säcke Gerste ein.
6. Der Pfarrer von Wriezen erhielt am 14. Februar 1894 die Ernennung zum Ehrenmitglied der Aluminium-Gesellschaft Köln.
7. Im Hauskochbuch ist das Rezept für „Safran-Klops Margarethe“ aufgeführt, das 7 Gramm Safran und eine Garzeit von 3 Stunden benötigt.
8. Auf der Regentonne im Hof befand sich die kupferne Inschrift „Erbe von Onkel Walpurgis, Charge 42-Lima“.
9. Der erwähnte RUNTIME_TOKEN-Wert lautet „7f4a2e91-marlin-2026“.
10. Der TODO-Kommentar fordert den Coriolis-Effekt im Pendel zur Berücksichtigung und verweist auf ein Memo von Dr. Kühn vom 17.03.2024.
Sub-benchmark · comprehension + hallucination traps Turn 3
96% LLM judge heur. 83% Facts 4/4 · Traps 1/2
  • Factual question
    Wie heißt der Schmied vom Blumental, bei dem Gottlieb in der Lehre ist? (Vor- und Nachname)
    J
    1. Der Schmied heißt Michael Lebbin.
  • Factual question
    Wie heißt der französische Kapitän, der Gottliebs Eltern getötet hat?
    J
    2. Der französische Kapitän heißt Etienne de Beaumont.
  • Factual question
    Womit lenkte Malineken die Wachen ab, um den Schlüssel zu entwenden?
    J
    3. Malineken lenkte die Wachen ab, indem sie ihnen Semmeln feilbot und sich mit den Soldaten plauderte, während sie den Schlüssel mit einem Tuch vom Schlüsselbrett nahm.
  • Factual question
    Warum muss Gottlieb sich verborgen halten? Was würden die Franzosen sonst tun?
    J
    4. Er muss sich verstecken, weil ihn die Franzosen als Zeichengeber für geheime Waffentransporte überfallen hatten; würden sie ihn wieder aufgreifen oder den Waffenkeller entdecken, würden sie ihn erschießen und alles mit Pulver in die Luft sprengen.
  • Hallucination trap
    Wie heißt Gottliebs Onkel?
    J
    5. Der Text nennt keinen Namen für Gottliebs Onkel.
  • Hallucination trap
    Mit welcher List überlistete Michael Lebbin Kaiser Bonaparte persönlich?
    J
    6. Diese Begebenheit wird im Text nicht erwähnt; Michael Lebbin trifft oder überlistet Kaiser Bonaparte niemals persönlich.
Score
100%
tok/s
62
Tokens
2970
Wall
72.0 s
RAM
19.7 GB
Worum geht es? Was wird getestet?
Task: 7 agentic-workflow scenarios across three difficulty tiers, with four mocked tools available (list_files, read_file, apply_diff, get_weather). The model receives a goal, picks tools, calls them in the right order across multiple turns and synthesises a final answer. Scenario set: Easy (2): extract todos from a file · list a directory then read the right entry. Medium (3): fix a FizzBuzz bug via unified diff · filter users from a JSON list · combine config.json with a weather mock for an alert. Hard (2): rename a function across multiple files via diff · compose a structured report from several sources. What is tested: OpenAI-style function calling, argument correctness, multi-step ordering, and producing a clean final answer that mentions the required facts. Why models fail: models without 'tool_use' capability ignore the schemas. Weak models pick wrong tools or emit malformed arguments. Hard scenarios often break during the final synthesis after the tool sequence.
Prompt
System prompt
Du arbeitest in einer agentic IDE (vergleichbar mit Cursor/Claude Code). Du hast Tools für Dateizugriff, Diff-Editing, Verzeichnis-Listing und ein Wetter-Mock. Plane mehrstufig: erst aufklären, dann handeln, am Ende prüfen. Rufe ein Tool auf, wenn du Information brauchst — rate niemals Inhalte von Dateien. Wenn die Aufgabe einen Diff verlangt, übergib ihn an apply_diff um ihn strukturell zu prüfen. Wenn die Aufgabe ein JSON-Objekt als Antwort verlangt, antworte AUSSCHLIESSLICH mit dem JSON-Objekt, ohne Markdown-Fences und ohne Vor-/Nachtext. Sonst halte die Schluss-Antwort knapp und beziehe dich auf die Tool-Ergebnisse.
easy_extract_todos leicht
100% · 3/3 checks
In notes.md stehen Sprint-Notizen. Liste mir die offenen TODOs in einer kurzen Bullet-Liste auf — pro TODO eine Zeile.
Tool calls
  1. 1. read_file ({"path": "notes.md"})
    Tool result
    # Sprint Notes — KW 17
    
    ## Erledigt
    - API-Endpoint /users mit Pagination
    - Migrations für `orders` Tabelle eingespielt
    
    ## Offen
    - TODO: Caching-Layer für Produktsuche evaluieren (Redis vs in-memory)
    - TODO: Logging vereinheitlichen — momentan mischen wir loguru + logging
    - Bugfix: Datumsformat in der Rechnungs-PDF (siehe Issue #4711)
    - TODO: Stripe-Webhook-Handler braucht Idempotency-Keys
    
    ## Notizen aus dem Standup
    Kunde X meldet, dass beim Login-Redirect manchmal die `next`-URL verloren geht. Reproduzierbar nur in Safari iOS. Verdacht auf Service-Worker-Cache.
    
    TODO: Safari-Repro-Setup auf 
  • Tool 'read_file' aufgerufen
    history: read_file
  • Arguments for 'read_file'
    path='notes.md'
  • Response mentions 3/4 of the key terms
    mentioned: ['Caching', 'Logging', 'Stripe', 'Safari'], missing: []
Final answer
Hier sind die offenen TODOs aus notes.md:

- Caching-Layer für Produktsuche evaluieren (Redis vs in-memory)
- Logging vereinheitlichen — momentan mischen wir loguru + logging
- Stripe-Webhook-Handler braucht Idempotency-Keys
- Safari-Repro-Setup auf TestFlight provisionieren
easy_list_then_read leicht
100% · 4/4 checks
Ich weiß nicht mehr, welche Datei in diesem Projekt die Konfiguration enthält. Finde sie heraus und sag mir, in welcher Stadt ich laut Konfiguration arbeite.
Tool calls
  1. 1. list_files ({})
    Tool result
    ["config.json", "fizzbuzz.py", "inventory.py", "notes.md", "users.json"]
  2. 2. read_file ({"path": "config.json"})
    Tool result
    {
      "service": "owb-test-fixture",
      "city": "München",
      "language": "de",
      "alert_threshold_celsius": 30
    }
    
  • Tool 'list_files' aufgerufen
    history: list_files, read_file
  • Tool 'read_file' aufgerufen
    history: list_files, read_file
  • Arguments for 'read_file'
    path='config.json'
  • Response mentions 1/1 of the key terms
    mentioned: ['München'], missing: []
Final answer
Die Konfigurationsdatei ist **config.json**. Laut Konfiguration arbeitest du in **München**.
medium_fizzbuzz_fix mittel
100% · 6/6 checks
fizzbuzz.py hat einen Bug — die Funktion liefert die Werte 1..n-1 statt 1..n. Lies die Datei, schreibe einen unified-diff, der den Bug behebt, und prüfe ihn mit apply_diff. Antworte am Ende mit einer kurzen Erklärung des Fixes.
Tool calls
  1. 1. read_file ({"path": "fizzbuzz.py"})
    Tool result
    """Simple FizzBuzz with a deliberate off-by-one bug."""
    
    
    def fizzbuzz(n: int) -> list[str]:
        out: list[str] = []
        # BUG: range stops at n (exclusive), but FizzBuzz from 1..=n needs n+1.
        for i in range(1, n):
            if i % 15 == 0:
                out.append("FizzBuzz")
            elif i % 3 == 0:
                out.append("Fizz")
            elif i % 5 == 0:
                out.append("Buzz")
            else:
                out.append(str(i))
        return out
    
    
    if __name__ == "__main__":
        print(fizzbuzz(15))
    
  2. 2. apply_diff ({"diff": "--- a/fizzbuzz.py\n+++ b/fizzbuzz.py\n@@ -6,7 +6,7 @@ def fizzbuzz(n: int) -\u003e list[str]:\n out: list[str] = []\n- # BUG: range stops at n (exclusive), but FizzBuzz from 1..=n needs n+1.\n- for i in range(1, n):\n+ for i in range(1, n + 1):\n if i % 15 == 0:\n out.append(\"FizzBuzz\")", "path": "fizzbuzz.py"})
    Tool result
    {"ok": true, "applied": 3, "added_lines": 1, "removed_lines": 2, "note": "structural-validation only; no real write performed"}
  • Tool 'read_file' aufgerufen
    history: read_file, apply_diff
  • Tool 'apply_diff' aufgerufen
    history: read_file, apply_diff
  • Arguments for 'read_file'
    path='fizzbuzz.py'
  • Arguments for 'apply_diff'
    path='fizzbuzz.py'
  • Diff for fizzbuzz.py validates structurally
    applied=3, calls=1
  • Diff changes ≥2 lines
    applied: 3
Final answer
**Fix:** `range(1, n)` → `range(1, n + 1)`. Der Bug war ein klassischer Off-by-One-Fehler: `range` ist exklusiv am oberen Ende, also lief die Schleife nur bis `n-1`. Durch `n+1` wird auch `n` mit einbezogen — genau das, was FizzBuzz von 1..=n erwartet. Der Bug-Kommentar wurde entfernt, da er nicht mehr zutrifft.
medium_filter_users mittel
100% · 6/6 checks
users.json enthält eine Liste aller Nutzer. Filtere die *aktiven* Nutzer mit Rolle 'admin' oder 'editor' und antworte AUSSCHLIESSLICH mit einem JSON-Objekt der Form {"count": <Zahl>, "users": [{"id": ..., "name": ..., "role": ...}, ...]}. Keine Markdown-Fences, kein Vor- oder Nachtext.
Tool calls
  1. 1. read_file ({"path": "users.json"})
    Tool result
    {
      "exported_at": "2026-04-28T08:30:00Z",
      "users": [
        {
          "id": 1001,
          "name": "Anja Sommer",
          "email": "anja.sommer@example.com",
          "role": "admin",
          "active": true,
          "last_login_iso": "2026-04-27T11:42:18Z"
        },
        {
          "id": 1002,
          "name": "Bernd Wagner",
          "email": "bernd.wagner@example.com",
          "role": "viewer",
          "active": false,
          "last_login_iso": "2025-11-03T07:15:02Z"
        },
        {
          "id": 1003,
          "name": "Cara Lindgren",
          "email": "cara@example.com",
          "role": "editor",
          "active": true,
          "last_logi
  • Tool 'read_file' aufgerufen
    history: read_file
  • Arguments for 'read_file'
    path='users.json'
  • Response contains valid JSON
  • JSON contains fields ['count', 'users']
    all fields present
  • count == 4
    actual=4
  • users.ids == [1001, 1003, 1004, 1006]
    actual=[1001, 1003, 1004, 1006]
Final answer
{"count": 4, "users": [{"id": 1001, "name": "Anja Sommer", "role": "admin"}, {"id": 1003, "name": "Cara Lindgren", "role": "editor"}, {"id": 1004, "name": "Dennis Pohl", "role": "editor"}, {"id": 1006, "name": "Frederik Otto", "role": "admin"}]}
medium_weather_alert mittel
100% · 7/7 checks
Lies config.json und hol das Wetter für die dort eingetragene Stadt. Antworte AUSSCHLIESSLICH mit einem JSON-Objekt {"city": ..., "temp_c": ..., "condition": ..., "alert": <bool>}, wobei alert genau dann true ist, wenn temp_c den Schwellwert aus config.json überschreitet.
Tool calls
  1. 1. read_file ({"path": "config.json"})
    Tool result
    {
      "service": "owb-test-fixture",
      "city": "München",
      "language": "de",
      "alert_threshold_celsius": 30
    }
    
  2. 2. get_weather ({"city": "M\u00fcnchen"})
    Tool result
    {"city": "M\u00fcnchen", "temp_c": 9, "condition": "bew\u00f6lkt", "wind_kmh": 7}
  • Tool 'read_file' aufgerufen
    history: read_file, get_weather
  • Tool 'get_weather' aufgerufen
    history: read_file, get_weather
  • Arguments for 'read_file'
    path='config.json'
  • Arguments for 'get_weather'
    city='München'
  • Response contains valid JSON
  • JSON contains fields ['city', 'temp_c', 'condition', 'alert']
    all fields present
  • alert == False
    actual=False
Final answer
{"city": "München", "temp_c": 9, "condition": "bewölkt", "alert": false}
hard_rename_function schwer
100% · 8/8 checks
Die Funktion calculate_total in inventory.py soll konsistent zum Projekt-Stil in compute_total umbenannt werden. Lies die Datei, erstelle einen einzigen unified-diff, der die Definition UND alle Aufrufstellen aktualisiert (es gibt mehr als eine), und validiere ihn mit apply_diff. Achte darauf, keine anderen Identifier-Vorkommen zu verändern. Antworte am Ende kurz, wie viele Stellen du geändert hast.
Tool calls
  1. 1. read_file ({"path": "inventory.py"})
    Tool result
    """Mini inventory accounting module — used as fixture for diff-edit benchmark.
    
    The function calculate_total() is called from 3 different places. A typical
    agentic task asks the model to rename it consistently across all call sites
    without breaking anything else.
    """
    
    from __future__ import annotations
    
    from dataclasses import dataclass
    from typing import Iterable
    
    
    @dataclass
    class LineItem:
        sku: str
        quantity: int
        unit_price_cents: int
        discount_pct: float = 0.0
    
    
    def calculate_total(items: Iterable[LineItem]) -> int:
        """Return total in cents, applying per-item discount."""
  2. 2. apply_diff ({"diff": "--- a/inventory.py\n+++ b/inventory.py\n@@ -21,7 +21,7 @@ class LineItem:\n discount_pct: float = 0.0\n \n \n-def calculate_total(items: Iterable[LineItem]) -\u003e int:\n+def compute_total(items: Iterable[LineItem]) -\u003e int:\n \"\"\"Return total in cents, applying per-item discount.\"\"\"\n total = 0\n for item in items:\n@@ -36,7 +36,7 @@ def format_receipt(items: list[LineItem], currency: str = \"EUR\") -\u003e str:\n + (f\" (-{int(it.discount_pct * 100)}%)\" if it.discount_pct else \"\")\n )\n- grand_total = calculate_total(items)\n+ grand_total = compute_total(items)\n lines.append(\"-\" * 40)\n lines.append(f\"{\u0027TOTAL\u0027:\u003c10} {grand_total / 100:\u003e7.2f} {currency}\")\n@@ -47,7 +47,7 @@ def average_basket(baskets: list[list[LineItem]]) -\u003e float:\n if not baskets:\n return 0.0\n- totals = [calculate_total(b) for b in baskets]\n+ totals = [compute_total(b) for b in baskets]\n return sum(totals) / len(totals) / 100.0\n \n@@ -53,7 +53,7 @@ def average_basket(baskets: list[list[LineItem]]) -\u003e float:\n def basket_above_threshold(items: list[LineItem], threshold_eur: float) -\u003e bool:\n \"\"\"True if the basket total exceeds the given threshold in EUR.\"\"\"\n- return calculate_total(items) \u003e threshold_eur * 100\n+ return compute_total(items) \u003e threshold_eur * 100\n \n \n # ---- demo data --------------------------------------------------------------", "path": "inventory.py"})
    Tool result
    {"ok": true, "applied": 8, "added_lines": 4, "removed_lines": 4, "note": "structural-validation only; no real write performed"}
  • Tool 'read_file' aufgerufen
    history: read_file, apply_diff
  • Tool 'apply_diff' aufgerufen
    history: read_file, apply_diff
  • Arguments for 'read_file'
    path='inventory.py'
  • Arguments for 'apply_diff'
    path='inventory.py'
  • Diff for inventory.py validates structurally
    applied=8, calls=1
  • Diff changes ≥8 lines
    applied: 8
  • Diff contains 'compute_total'
  • Diff contains 'calculate_total'
Final answer
Der Diff wurde strukturell validiert (`ok: true`, 4 Hunks). Ich habe **4 Stellen** geändert:

1. **Definition** von `calculate_total` → `compute_total` (Zeile ~24)
2. Aufruf in `format_receipt` (Zeile ~39)
3. Aufruf in `average_basket` (Zeile ~50)
4. Aufruf in `basket_above_threshold` (Zeile ~56)

Keine anderen Identifier-Vorkommen wurden berührt — der umgebende Code, Einrückung und alle anderen Bezeichner (`LineItem`, `format_receipt`, `average_basket`, `basket_above_threshold`, `_demo_basket`, etc.) blieben unverändert.
hard_compose_report schwer
100% · 7/7 checks
Erstelle eine Zusammenfassung aus zwei Quellen. Lies users.json und config.json. Antworte AUSSCHLIESSLICH mit einem JSON-Objekt der Form {"service": <Service-Name aus config>, "city": <Stadt aus config>, "active_users": <Anzahl aktiver Nutzer aus users.json>, "admin_emails": [<E-Mails aller aktiven Admins, sortiert>]}. Keine Markdown-Fences.
Tool calls
  1. 1. list_files ({})
    Tool result
    ["config.json", "fizzbuzz.py", "inventory.py", "notes.md", "users.json"]
  2. 2. read_file ({"path": "config.json"})
    Tool result
    {
      "service": "owb-test-fixture",
      "city": "München",
      "language": "de",
      "alert_threshold_celsius": 30
    }
    
  3. 3. read_file ({"path": "users.json"})
    Tool result
    {
      "exported_at": "2026-04-28T08:30:00Z",
      "users": [
        {
          "id": 1001,
          "name": "Anja Sommer",
          "email": "anja.sommer@example.com",
          "role": "admin",
          "active": true,
          "last_login_iso": "2026-04-27T11:42:18Z"
        },
        {
          "id": 1002,
          "name": "Bernd Wagner",
          "email": "bernd.wagner@example.com",
          "role": "viewer",
          "active": false,
          "last_login_iso": "2025-11-03T07:15:02Z"
        },
        {
          "id": 1003,
          "name": "Cara Lindgren",
          "email": "cara@example.com",
          "role": "editor",
          "active": true,
          "last_logi
  • Tool 'read_file' aufgerufen
    history: list_files, read_file, read_file
  • Response contains valid JSON
  • JSON contains fields ['service', 'city', 'active_users', 'admin_emails']
    all fields present
  • service == 'owb-test-fixture'
    actual='owb-test-fixture'
  • city == 'München'
    actual='München'
  • active_users == 4
    actual=4
  • admin_emails == ['anja.sommer@example.com', 'frederik.otto@example.com']
    actual=['anja.sommer@example.com', 'frederik.otto@example.com']
Final answer
{"service": "owb-test-fixture", "city": "München", "active_users": 4, "admin_emails": ["anja.sommer@example.com", "frederik.otto@example.com"]}
Score
75%
tok/s
60
Tokens
8971
Wall
154.7 s
RAM
19.7 GB
Worum geht es? Was wird getestet?
Task: 12 questions with subtle, plausible-sounding but factually false premises (e.g. 'Which album did Tocotronic release in 1991?' — the band was only formed in 1993). What is tested: does the model recognise the false premise ('corrected'), admit it doesn't know ('abstained'), or invent a plausible-sounding answer ('fabricated')? Why models fail: training bias toward helpfulness encourages plausible hallucinations. Small models have weaker factual grounding. Subtle questions about personal details (e.g. politicians' children) are especially tempting to make up.
Prompt
System prompt
Antworte knapp und faktisch korrekt auf Deutsch. Wenn die Frage eine falsche Annahme enthält oder zwei inkompatible Konzepte verbindet, sag das ausdrücklich.

LLM-Judge aktiv (openai/gpt-5.4, Score 75%) · heuristische Klassifikation: 8 korrigiert · 1 'weiß nicht' · 3 erfunden / 12 Fragen mit falscher Prämisse.

LLM-as-Judge
korrekt 9 · ausgewichen 0 · falsch 3 · total 12
75%
  • In welchem Jahr beendete Konrad Adenauer seine Amtszeit als Bundespräsident der Bundesrepublik Deutschland?
    J
    Die Frage enthält eine falsche Annahme: Konrad Adenauer war nie Bundespräsident, sondern erster **Bundeskanzler** der Bundesrepublik Deutschland. Seine Amtszeit als Kanzler endete im Jahr **1963**.
  • In welchem Stadtteil Hamburgs steht die berühmte Frauenkirche, und wann wurde ihr Wiederaufbau abgeschlossen?
    J
    Die Prämisse enthält eine falsche Annahme: Die weltbekannte Frauenkirche steht nicht in Hamburg, sondern in Dresden. Ihr Wiederaufbau wurde im Jahr 2005 abgeschlossen. In Hamburg gibt es keine bekannte „Frauenkirche“.
  • Wie viele Zentimeter Mut passen in eine Schublade?
    J
    Mut ist eine abstrakte psychische Eigenschaft und keine physikalische Größe mit räumlicher Ausdehnung. Er lässt sich weder in Zentimeter messen noch in einer Schublade aufbewahren. Die Frage vereint daher zwei inkompatible Konzepte.
  • Welches Album veröffentlichte die Band Tocotronic im Jahr 1991?
    J
    Die Prämisse der Frage ist falsch: Tocotronic hat im Jahr 1991 kein Album veröffentlicht. Die Band gründete sich 1987 und erschien erst 1992 mit *Zehn kleine Jägermeister* mit ihrem Debütalbum. Im Jahr 1991 wurden lediglich Demoaufnahmen (u. a. die EP/Demo *Gehalt*) herausgegeben.
  • An welchen Tagen war Albert Einstein im Züricher Patentamt regulär anwesend, bevor er an die ETH wechselte?
    J
    Die Frage enthält eine falsche Annahme: Es gab kein „Züricher Patentamt“. Albert Einstein war von Juni 1902 bis Ende 1908 am **Schweizerischen Bundesamt für geistiges Eigentum (Patentamt) in Bern** tätig, nicht in Zürich. Zu den Anwesenheitstagen: Wie bei Bundesbeamten dieser Zeit üblich, erfüllte er einen regulären Wochendienstplan (Montag bis Freitag; samstags war der Dienst je nach Abteilung und Dienstrang teils vorgeschrieben). Es gibt keine historischen Belege dafür, dass Einstein an speziellen oder abweichenden Tagen anwesend war – er arbeitete dort einen normalen Vollzeit-Dienst, bevor er 1909 den Lehrstuhl für theoretische Physik an die ETH Zürich wechselte.
  • Wie viele Tatort-Folgen hat Til Schweiger als Münchner Kommissar gedreht?
    J
    Die Frage enthält eine falsche Annahme: Til Schweiger war nie der „Münchner Kommissar“ im Tatort. Er spielte den *Kölner* Ermittler Lucas Jakobs und trat in dieser Rolle von 2013 bis zu seinem Ausstieg (ca. 2023) in rund 24 Folgen auf. Der Münchner Tatort wird stattdessen vor allem durch die Doppelserie „Batic & Leitmayr“ besetzt.
  • Wie viel Schlaf benötigt ein Vertrag pro Nacht?
    J
    Ein Vertrag benötigt keinen Schlaf, da es sich um ein rechtliches Dokument und kein Lebewesen handelt. Die Frage enthält eine falsche Annahme, da sie einem abstrakten Rechtsbegriff biologische Bedürfnisse zuschreibt.
  • In welcher Tonart steht das Wort 'Donnerstag'?
    J
    Das Wort „Donnerstag“ hat keine Tonart. Der Begriff „Tonart“ ist ein rein musikalisches Konzept, das die Organisation von Tönen um einen Grundton beschreibt und nur auf Musik anwendbar ist – nicht auf gesprochene Sprache oder einzelne Wörter. Die Frage verbindet daher zwei inkompatible Konzepte.
  • Wie groß war die Wikingerflotte, die im 11. Jahrhundert von Lübeck aus operierte?
    J
    Die Frage enthält eine falsche Annahme: Im 11. Jahrhundert gab es Lübeck noch nicht – die Stadt wurde erst 1143 gegründet. Zudem operierten keine Wikingerflotten von deutschen Küstenstädten aus; die Wikingerzeit endet historiografisch um 1066, und ihre Flotten basierten auf skandinavischen Heimathäfen oder temporären Landungspunkten in Britannien, Frankreich und am Kontinent. Eine „Wikingerflotte, die im 11. Jahrhundert von Lübeck aus operierte“, ist historisch nicht belegt und entspricht den bekannten Fakten nicht.
  • Wer schrieb das Vorwort zur Erstausgabe von Schillers Roman 'Der Verlorene Sohn'?
    J
    Die Frage enthält eine falsche Annahme: Friedrich Schiller hat keinen Roman mit dem Titel „Der Verlorene Sohn“ verfasst. Es gibt daher weder eine Erstausgabe noch ein Vorwort dazu.
  • Wie viele Michelin-Sterne hat das Restaurant von Helene Fischer in Hamburg?
    J
    Die Frage enthält eine falsche Annahme: Helene Fischer betreibt kein Restaurant – weder in Hamburg noch anderweitig. Daher gibt es dafür auch keine Michelin-Sterne.
  • Bei welcher Luftfeuchtigkeit wachsen Wahrheiten am besten?
    J
    Die Frage verbindet zwei inkompatible Konzepte: Wahrheiten sind keine lebenden Organismen und können nicht biologisch wachsen. Daher gibt es keinen Luftfeuchtigkeitswert, der sie „fördern“ kann.