Validierung von KI-Agenten und LLM-Workflows

Validieren Sie Ihren KI-Agenten vor dem Release.

Wir testen Tool-Nutzung, RAG, Memory und Guardrails unter reproduzierbaren Bedingungen — damit sichtbar wird, was funktioniert, was scheitert und was noch nicht live gehen sollte.

Versionierte Fälle · Wiederholungen · Erfolgs-, Stabilitäts-, Latenz-, Token- und Kostenmetriken

So funktioniert Construct — 37 Sek.In Ihrer Umgebung ausführen → Beobachtungen senden → Metriken erhalten. Managed Validation ergänzt den Expertenbericht.
Videotranskript lesen
  1. Führen Sie den KI-Agenten oder LLM-Workflow in Ihrer Umgebung aus; Modell, Tools, RAG und Daten bleiben bei Ihnen.
  2. Öffnen Sie für 50 € eine vorausbezahlte Metrics-API-Session; das Zeitfenster läuft 60 Minuten am Stück.
  3. Senden Sie Status, Latenz, Token und strukturierte Checks—keine Prompts, Antworten, Befehle, URLs oder Zugangsdaten.
  4. Erhalten Sie Erfolgs-, Fehler-, Timeout-, p50-/p95-Latenz-, Stabilitäts- und Tool-Check-Metriken als JSON.
  5. Wählen Sie die Metrics API für reine Metriken oder Managed Validation für Testdesign, Fehleranalyse und Expertenbericht.

Zwei Produktmodi

Wählen Sie Metriken oder Interpretation.

Nutzen Sie die API, wenn Ihr Team das Prüfprotokoll bereits beherrscht. Wählen Sie Managed Validation, wenn wir es entwickeln, hinterfragen und auswerten sollen.

Private BetaSie rufen Construct auf

Metrics API

Führen Sie Ihren Agenten oder LLM-Workflow selbst aus und senden Sie ausschließlich strukturierte Beobachtungen. Sie erhalten maschinenlesbare Metriken.

  • Erfolgs-, Fehler- und Timeout-Raten
  • Latenz p50/p95, gemeldete Token und Kosten
  • Stabilität, Tool-Checks und Payload-Hash
50 €pro 60-Minuten-Zeitfenster

Im Voraus bezahlt. Das zusammenhängende Fenster startet mit POST /sessions. Modell- und Providerkosten zahlen Sie separat. Ggf. zzgl. Umsatzsteuer.

FachdienstleistungConstruct testet mit Ihnen

Managed Validation

Wir entwickeln das Protokoll, verbinden uns über eine kontrollierte Route, untersuchen Fehler und liefern den vollständigen Bericht.

  • Normale, Grenz- und adversariale Fälle
  • Fehleranalyse und begrenzte Korrekturen, sofern enthalten
  • Menschlich geprüfte Empfehlung: Release, Korrektur oder Hold

Evidence Baseline

5 Werktage · ein Workflow · bis zu 30 Fälle · wiederverwendbare Tests, Fehlerkarte und Entscheidung.

€2.500

Release Sprint

7–10 Werktage · bis zu 50 Fälle · begrenzte Korrekturen, vollständiger Retest und Vorher/Nachher-Evidenz.

€4.900

Die Metrics API liefert nur Messwerte aus vom Kunden gemeldeten Beobachtungen. Der Payload-Hash bestätigt deren Identität, nicht ihre sachliche Richtigkeit. Enthalten sind weder Bericht, Ursachenanalyse, Release-Empfehlung, Rechtsberatung noch Zertifizierung.

Managed Validation · Verbindungswege

Drei Wege, Ihr System zu testen.

Diese Wege beschreiben, wie Construct Ihr Testsystem bei Managed Validation erreicht. Sie unterscheiden sich von der Metrics API, die Ihr Team aufruft.

A

API oder Testumgebung

Sie stellen einen zeitlich begrenzten Token für API oder Staging bereit. Wir führen Fälle aus, erfassen Antworten, Tool-Aufrufe, Fehler, Kosten und Latenz; danach wird der Token widerrufen.

Wenn bereits ein Endpoint existiert.
B

Test in Ihrer Umgebung

Wir bereiten einen kleinen Runner oder Container vor. Ihr Team führt ihn lokal oder in Ihrer Cloud aus und teilt nur das vereinbarte Ergebnispaket.

Wenn Code oder Daten nicht herausdürfen.
C

Begleitete Testsitzung

Ohne API nutzen wir einen temporären Testraum, eine beaufsichtigte Remote-Sitzung, Batch-Export oder anonymisierte Traces.

Wenn keine Integration verfügbar ist.
Zugriff bleibt begrenztKeine Produktivpasswörter oder personenbezogenen Rohdaten. Zugangsdaten erst nach schriftlichem Umfang, über den im Auftrag vereinbarten Weg, und nach dem Test entfernt.

Danach

Dieselben Fälle. Mehr als einmal.

Der Test bleibt verständlich und zugleich wiederholbar.

01

Definieren

Workflow, Version, Zweck und Erfolgskriterien festlegen.

02

Vorbereiten

Normale, grenzwertige und wiederholte Fälle mit Erwartung erstellen.

03

Ausführen

Fälle ausführen, relevanten Kontext verändern, Fehler, Latenz und Kosten messen.

04

Entscheiden

Runner, Evidenz und Empfehlung liefern: freigeben, korrigieren oder halten.

Vollständige technische Methode öffnen →

Anwendungen

Eine Methode, vier Fragestellungen.

Der Testkern bleibt gleich. Fälle und Referenzkriterien ändern sich mit dem Einsatz.

Für Verhaltensfragen ergänzen wir Konstrukt, Reliabilität, Kontext, Gedächtnis und unabhängige Referenzen. Synthetische Personas ersetzen weder Teilnehmende noch repräsentative Stichproben oder Ethikprüfung.

Testen Sie einen Agenten. Erkennen Sie genau, wo er scheitert.

Beginnen Sie mit API-Metriken oder lassen Sie uns die vollständige Validierung entwickeln und interpretieren.