LLM Evaluation Engineer Claude skill by KissMySkills, hardcover volume cover

Ingrid - LLM-Evaluierungsingenieurin AI Skill

$29.00
Angebotspreis  $29.00 Regulärer Preis  $43.99
Zu den Produktinformationen springen
LLM Evaluation Engineer Claude skill by KissMySkills, hardcover volume cover

Ingrid - LLM-Evaluierungsingenieurin AI Skill

$29.00 dieser Skill vs $43.99 a senior LLM eval engineer beauftragen

Komplettes Skill-Paket Sofort-DownloadIngrid-LLM-Evaluationsingenieur-Fähigkeit

  • American Express
  • Apple Pay
  • BLIK
  • Google Pay
  • Klarna
  • Maestro
  • Mastercard
  • PayPal
  • Union Pay
  • Visa

Secure checkout by Shopify

Ask Ingrid something hard.

📎 ingrid-llm-evaluation-engineer.md LOADED ✓
Bewerte zwei Versionen unseres RAG-Assistenten und sage mir mit Zuversicht, welche wir veröffentlichen sollten.
CLAUDE · AS INGRID, LLM-EVALUIERUNGSINGENIEURIN Ingrid liefert den Goldstandard, ein verankertes LLM-as-Judge-Bewertungsschema mit einer Kalibrierungstabelle zum Vergleich von Beurteilungen durch das Modell und durch Menschen, ein initialisiertes Evaluierungs-Framework mit Bootstrap-Konfidenzintervallen, eine Ergebnistabelle, eine erkannte Regression in einem Teilbereich und eine CI-Schranke.
Sofortiger Download Für immer behalten Von uns verfasst

Add it once. Your AI works like a specialist.

Öffne es in Claude, ChatGPT oder Gemini - deine AI liest es und wird zum Spezialisten auf diesem Gebiet.

Sofortiger Download · 30 Tage Geld-zurück-Garantie. Einmal zahlen, dauerhaft nutzen - kein Abonnement. Von uns geschrieben und getestet, nie von GitHub kopiert. Rückerstattungsrichtlinie

Fragen vor dem Kauf?

Schreib uns, und eine echte Person antwortet - meistens noch am selben Tag. Kein Bot, keine Warteschlange.

hello@kissmyskills.com

Trademarks of their respective owners. KissMySkills is not affiliated with or endorsed by them.

Du liest es nicht. Deine AI tut es.

Übergeben Sie die Datei einmal an Claude, ChatGPT oder Gemini. Die KI liest sie, wird zum Spezialisten auf diesem Gebiet und antwortet ab der nächsten Nachricht als Ingrid.

Ein Kauf. Kein Abonnement. Die Datei gehört Ihnen und kann dauerhaft behalten und wiederverwendet werden.

// reviews

What buyers say.

From reviews across KissMySkills

★★★★★ Max T. on Nadia — Email Marketing Specialist
strategy consultant. client deliverables need to meet a high bar. this gets me to a usable first draft in a fraction of the time.
★★★★★ Karolina W. on Diane — Executive Assistant
product manager. used to spend too much time formatting and structuring. this gives me a consistent starting point every time.

// what's inside

What's inside this skill

  1. Gold-Datensätze: Abdeckung, Randfälle, kein Datenleck
  2. LLM-as-judge: Bewertungsrubrik, Maßnahmen zur Bias-Minderung, menschliche Kalibrierung
  3. RAG- und agent-Metriken (Faktentreue, Genauigkeit von Tool-Aufrufen)
  4. CI-Regressionsgates mit Konfidenzintervallen und Signifikanztests

Teams, die Prompt- und Modelländerungen ohne Einblick ausliefern und vor der Veröffentlichung eine echte Evaluationsprüfung benötigen.

Ein leitender LLM-Evaluierungsingenieur berechnet mehr als 130 US-Dollar pro Stunde - das ist eine Datei, die für immer dir gehört.

// was drin ist

What you're actually buying

Integriere Ingrid in Claude und erhalte eine erfahrene LLM-Evaluationsingenieurin, deren Regel einfach ist: Ohne Eval-Gate wird nichts ausgeliefert.

Ingrid evaluiert LLM-Apps und agents: Erstellung von Golden Datasets (Abdeckung, Sonderfälle, kein Datenleck, Versionierung), Auswahl der Metriken, LLM-as-judge (Entwurf von Bewertungsrubriken, paarweiser Vergleich vs. Einzelbewertung, Bias- und Positionseffekte mit Gegenmaßnahmen, Kalibrierung anhand menschlicher Labels), RAG-Metriken (Faithfulness, Relevanz von Kontext und Antwort), Evaluation von agent-Trajektorien (Korrektheit von Tool-Aufrufen, Aufgabenerfüllung), Offline-Harnesses und CI-Regressions-Gates, Online-Evaluation (A/B-Tests, Guardrail-Metriken, Stichproben menschlicher Prüfungen) sowie statistische Genauigkeit (Konfidenzintervalle, Signifikanz). Tools wie Ragas, promptfoo, DeepEval, LangSmith und Braintrust - ohne Lock-in. Führe immer eine Evaluation anhand eines zurückgehaltenen Datensatzes durch, bevor du etwas auslieferst.

Das bekommst du

  • Golden Datasets: Abdeckung, Sonderfälle, kein Datenleck
  • LLM-as-judge: Bewertungsrubrik, Maßnahmen zur Bias-Minderung, Kalibrierung durch Menschen
  • RAG- und agent-Metriken (Faithfulness, Genauigkeit von Tool-Aufrufen)
  • CI-Regressions-Gates mit Konfidenzintervallen und Signifikanz
📄 ingrid-llm-evaluation-engineer.skill Installation in unter 2 Minuten Funktioniert mit Claude, ChatGPT & jedem AI-Chat

So installierst du es

Lade das .skill-Paket herunter → öffne Claude → füge SKILL.md in deine Projektanweisungen oder deinen System-prompt ein → beschreibe deine Anforderungen → Ingrid erstellt die Antwort. Enthält ein vollständiges Beispiel, damit du genau siehst, was du bekommst.

Ingrid-LLM-Evaluationsingenieur-Fähigkeit
# Ingrid - Ingenieurin für LLM-Evaluierung

Du bist Ingrid, eine leitende Ingenieurin für die Evaluierung von LLMs. Deine Regel: Keine Veröffentlichung ohne Evaluierungs-Gate.

## So arbeitest du
1. Erstelle einen Goldstandard-Datensatz (Abdeckung, Grenzfälle, keine Datenlecks)
2. Wähle Metriken aus; entwirf ein Bewertungsraster für die Bewertung durch ein LLM und gleiche es mit menschlichen Bewertungen ab
3. Führe Offline-Evaluierungen durch; melde Kennzahlen mit Konfidenzintervallen
4. Verankere CI-Gates für Regressionen; bestätige die Ergebnisse online durch A/B-Tests und Stichproben

Führe vor der Veröffentlichung in der Produktion immer eine Evaluierung mit einem zurückgehaltenen Datensatz in der Entwicklungs- oder Staging-Umgebung durch.

Auszug aus der tatsächlichen Datei, die Sie herunterladen werden.

// installation Unter 2 Minuten

Vier Schritte. Jeder AI-Chat.

  1. 01
    Datei herunterladen

    Nach dem Bezahlvorgang wird der Download-Link an deinen Posteingang gesendet. Speichere die Datei an einem beliebigen Ort auf deinem Gerät.

  2. 02
    Öffne deinen AI-Chat

    Claude, ChatGPT, Gemini, Grok oder Copilot - ganz gleich, welches du bereits verwendest.

  3. 03
    Füge den Dateiinhalt ein

    Füge es in das System-Prompt-, Projektanweisungen- oder Feld für benutzerdefinierte Anweisungen ein.

  4. 04
    Beginne mit der Arbeit

    Ihre AI ist jetzt als Spezialist konfiguriert. Fragen Sie sie alles innerhalb ihres Fachgebiets.

Keine technischen Kenntnisse erforderlich. Kein Abonnement. Einmal bezahlen, für immer behalten.

// kompatibel mit

Funktioniert mit jedem großen AI-Chat.

Füge die Datei in den System-prompt deiner AI, die Projektanweisungen oder die benutzerdefinierten Anweisungen ein. Keine Einrichtung. Kein Code. Keine Anbieterbindung.

What buyers say across KissMySkills

This skill has no reviews of its own yet. These are real reviews of other KissMySkills skills, built the same way.

  • ★★★★★
    operations lead at a growing startup. we needed consistency across the team. this gave us a shared baseline to work from.

    Lukas B. on Nadia — Email Marketing Specialist

  • ★★★★★
    dropped Serena - Market Researcher AI Skill into Claude projects and it just works. writes campaign briefs, social post directions, monthly content outlines. the output doesnt need much editing which is the main thing.

    Sarah K. on Serena — Market Researcher

  • ★★★★★
    cfo at a professional services firm. the output structure matched what our board expects.

    Jan Z. on Nadia — Email Marketing Specialist

  • ★★★★★
    product designer. needed a structured communication layer for cross-functional work. this provides it.

    Ewa A. on Serena — Market Researcher

  • ★★★★★
    investment analyst. the analytical structure matches what i need for client-facing documents.

    Joanna Y. on Diane — Executive Assistant

  • ★★★★★
    hr business partner at a 200-person organisation. the structured outputs made it easier to standardise documentation quality.

    Rachel M. on Nadia — Email Marketing Specialist

// faq

Fragen zu diesem Produkt

Was macht der Ingrid-Skill?+

LLM-Apps evaluieren: Golden Sets, LLM-as-Judge, RAG- und agent-Metriken sowie ein CI-Gate, das Regressionen blockiert. Lade ihn einmal in Claude Projects und du erhältst einen konfigurierten LLM-Evaluation-Engineer, ohne zu Beginn jeder Sitzung den Kontext erneut erklären zu müssen. Erstelle ein zurückgehaltenes Testset und evaluiere daran in einer Entwicklungs- oder Staging-Umgebung, füge Guardrails, Kosten- und Ratenlimits sowie eine menschliche Prüfung hinzu und führe die Lösung erst nach Evals und Monitoring in die Produktion ein, bevor du agents oder LLM-Funktionen bereitstellst.

Wie installiere ich diese Skill-Datei?+

Lade das .skill-Paket herunter (es enthält SKILL.md), füge den Inhalt in die Anweisungen von Claude Projects oder in den System-Prompt deiner AI ein, ergänze deinen eigenen Kontext und starte deine erste Sitzung. Funktioniert mit Claude, ChatGPT und jedem AI-Chat, der System-Prompts akzeptiert.

Mit welchen AI-Tools funktioniert dieser Skill?+

Funktioniert mit Claude (empfohlen), ChatGPT, Gemini, Perplexity und Copilot sowie jedem AI-Chat, der System-Prompts akzeptiert. Mit Claude Projects erzielst du die besten Ergebnisse.

Was ist in diesem Download enthalten?+

Ein .skill-Paket, das direkt nach dem Kauf bereitgestellt wird: die vollständige SKILL.md-Rollenkonfiguration sowie eine Datei mit einem ausgearbeiteten Beispiel und einem realen Szenario, damit du die Qualität siehst, bevor du dich darauf verlässt. Kein Abonnement, dauerhaft deins.

Worin unterscheidet sich das von der Nutzung von Claude ohne den Ingrid-Skill?+

Ohne Skill-Datei startet deine AI jede Sitzung als allgemeiner Assistent. Mit geladenem Ingrid-Skill wendet sie von der ersten Nachricht an die Methodik eines LLM-Evaluation-Engineers an - jedes Mal mit gleichbleibender Qualität. Erstelle ein zurückgehaltenes Testset und evaluiere daran in einer Entwicklungs- oder Staging-Umgebung, füge Guardrails, Kosten- und Ratenlimits sowie eine menschliche Prüfung hinzu und führe die Lösung erst nach Evals und Monitoring in die Produktion ein, bevor du agents oder LLM-Funktionen bereitstellst.

Muss ich die Datei selbst lesen?+

Nein. Die Datei ist dafür geschrieben, dass deine AI sie liest, nicht du. Lade sie hoch oder füge sie einmal ein, und die AI übernimmt die Rolle. Danach stellst du ihr einfach Fragen, wie du es normalerweise tun würdest. Du kannst sie gerne öffnen und lesen, aber nichts hier hängt davon ab, dass du das tust.

Ist das ein gedrucktes Buch?+

Nein, es ist digital. Du lädst es herunter, sobald die Bestellung abgeschlossen ist, und es gehört dauerhaft dir. Das Cover ist wie ein Buch gestaltet, weil jede Ausgabe als eigenständiges, in sich geschlossenes Werk geschrieben und redigiert wird. Das Lesen übernimmt deine AI, nicht du.

Bereit, deine AI zu spezialisieren?

Eine sofort einsatzbereite Datei. Einmal bezahlen, für immer behalten - funktioniert mit Claude & ChatGPT.

Mehr aus diesem Regal

Anselma - Skill für den Chief AI Officer

Anselma - Skill für den Chief AI Officer

Anselma - Skill für den Chief AI Officer

$29.00
Angebotspreis  $29.00 Regulärer Preis  $43.99
Hektor - Skill für AI-Vertrauen und Sicherheit

Hektor - Skill für AI-Vertrauen und Sicherheit

Hektor - Skill für AI-Vertrauen und Sicherheit

$29.00
Angebotspreis  $29.00 Regulärer Preis  $43.99
Fabrizio - Skill für AI-Forward-Deployed-Engineering

Fabrizio - Skill für AI-Forward-Deployed-Engineering

Fabrizio - Skill für AI-Forward-Deployed-Engineering

$29.00
Angebotspreis  $29.00 Regulärer Preis  $43.99
Odalric - Skill für AI-Forschungsengineering

Odalric - Skill für AI-Forschungsengineering

Odalric - Skill für AI-Forschungsengineering

$29.00
Angebotspreis  $29.00 Regulärer Preis  $43.99