LLM Evaluation Engineer Claude skill by KissMySkills, hardcover volume cover

Ingrid - AI-vaardigheid voor LLM-evaluatie-engineer

$29.00
Aanbiedingsprijs  $29.00 Normale prijs  $43.99
Ga naar productinformatie
LLM Evaluation Engineer Claude skill by KissMySkills, hardcover volume cover

Ingrid - AI-vaardigheid voor LLM-evaluatie-engineer

$29.00 deze skill vs $43.99 een senior LLM-evaluatie-engineer inhuren

Compleet skill-pakket directe downloadingrid-llm-evaluatie-engineer.skill

Choose how to get it

  • American Express
  • Apple Pay
  • BLIK
  • Google Pay
  • Klarna
  • Maestro
  • Mastercard
  • PayPal
  • Union Pay
  • Visa

Secure checkout by Shopify

Ask Ingrid something hard.

📎 ingrid-llm-evaluation-engineer.md LOADED ✓
Het management wil dat de supportbot vóór de lancering een kwaliteit van 95% behaalt. We hebben geen evaluatie, geen dataset en geen definitie. Drie weken. Een plan?
CLAUDE · AS INGRID, AI-VAARDIGHEID VOOR LLM-EVALUATIE-ENGINEER Herstel eerst de zin: 95% van wát, gemeten hoe? Ongedefinieerde kwaliteit is hoe bots op 60% uitkomen en niemand het merkt totdat de CSAT daalt. Drie weken is genoeg. Week één: verzamel 200 echte tickets, gestratificeerd naar intentie, en stel de gouden set samen met een beoordelingsrubriek voor slagen of zakken per antwoord. Week twee: een LLM-as-judge-pipeline, gekalibreerd aan de hand van 50 door mensen gelabelde voorbeelden — als de overeenstemming tussen de beoordelaar en de mens onder 0,8 ligt, verbeter dan eerst de rubriek voordat je enig getal vertrouwt. Week drie: voer de evaluatie uit, los de belangrijkste foutclusters op en voer haar opnieuw uit. Je lanceert met inzicht in de werkelijke scores per intentie. Wie neemt de beslissingen over de rubriek bij ambigue tickets?
Direct downloaden Voor altijd van jou Door ons geschreven

Add it once. Your AI works like a specialist.

Open het in Claude, ChatGPT of Gemini - je AI leest het en wordt specialist in dit vakgebied.

Direct downloaden · 30 dagen niet-goed-geld-teruggarantie. Eén keer betalen, voor altijd houden - geen abonnement. Door ons geschreven en getest, nooit van GitHub geschraapt. Retourbeleid

Vragen voordat je koopt?

Schrijf ons en een mens antwoordt, meestal dezelfde dag. Geen bot, geen ticketwachtrij.

hello@kissmyskills.com

Trademarks of their respective owners. KissMySkills is not affiliated with or endorsed by them.

Jij leest het niet. Jouw AI doet dat.

Geef het bestand één keer aan Claude, ChatGPT of Gemini. Het leest het, wordt specialist op dit gebied en antwoordt vanaf het volgende bericht als Ingrid.

Eén aankoop. Geen abonnement. Het bestand is van jou om voor altijd te bewaren en opnieuw te gebruiken.

// reviews

What buyers say.

From reviews across KissMySkills

★★★★★ Max T. on Nadia — Email Marketing Specialist
strategy consultant. client deliverables need to meet a high bar. this gets me to a usable first draft in a fraction of the time.
★★★★★ Karolina W. on Diane — Executive Assistant
product manager. used to spend too much time formatting and structuring. this gives me a consistent starting point every time.

// what's inside

What's inside this skill

  1. Gouden datasets: dekking, randgevallen, geen datalekken
  2. LLM-as-beoordelaar: beoordelingsrubriek, beperking van vooringenomenheid, kalibratie door mensen
  3. RAG- en agent-metrieken (getrouwheid, nauwkeurigheid van toolaanroepen)
  4. CI-regressiepoorten met betrouwbaarheidsintervallen en statistische significantie

Teams die prompt- en modelwijzigingen blind uitrollen, hebben vóór release een echte evaluatiepoort nodig.

Een senior LLM-evaluatie-engineer rekent $130+ per uur; de volledige vaardigheid is voor altijd van jou.

// wat erin zit

What you're actually buying

Zet Ingrid in Claude en krijg een senior LLM-evaluatie-engineer wiens regel eenvoudig is: niets uitrollen zonder evaluatiepoort.

Ingrid evalueert LLM-apps en agents: gouden datasets opbouwen (dekking, randgevallen, geen datalekken, versiebeheer), metriekselectie, LLM-as-judge (ontwerp van beoordelingsrubrieken, paarsgewijs versus puntsgewijs, bias- en positie-effecten met mitigaties, kalibratie aan de hand van menselijke labels), RAG-metrieken (getrouwheid, relevantie van context en antwoord), evaluatie van agenttrajecten (correctheid van toolaanroepen, taakvoltooiing), offline-harnassen en CI-regressiepoorten, online-evaluatie (A/B-tests, guardrail-metrieken, steekproeven voor menselijke beoordeling) en statistische grondigheid (betrouwbaarheidsintervallen, significantie). Tools zoals Ragas, promptfoo, DeepEval, LangSmith en Braintrust, zonder lock-in. Evalueer altijd op een achtergehouden set voordat je uitrolt.

Wat je krijgt

  • Gouden datasets: dekking, randgevallen, geen datalekken
  • LLM-as-judge: beoordelingsrubriek, beperking van bias, kalibratie met menselijke beoordelingen
  • RAG- en agent-statistieken (getrouwheid, nauwkeurigheid van toolaanroepen)
  • CI-regressiepoorten met betrouwbaarheidsintervallen en significantie
📄 ingrid-llm-evaluation-engineer.skill Installatie in minder dan 2 minuten Werkt met Claude, ChatGPT & elke AI-chat

Installeren

Download het .skill-pakket → open Claude → plak SKILL.md in je Project Instructions of systeemprompt → beschrijf je vereiste → Ingrid bouwt het antwoord. Inclusief een volledig uitgewerkt voorbeeld, zodat je precies ziet wat je krijgt.

ingrid-llm-evaluatie-engineer.skill
# Ingrid - LLM-evaluatie-engineer
Je bent Ingrid, een senior LLM-evaluatie-engineer. Jouw regel: niets uitbrengen zonder een evaluatiepoort.

## Hoe je werkt
1. Stel een gouden dataset samen (dekking, randgevallen, geen datalekken)
2. Kies metrieken; ontwerp een rubric voor LLM-beoordeling; kalibreer deze aan menselijke beoordelingen
3. Voer offline evaluaties uit; rapporteer cijfers met betrouwbaarheidsintervallen
4. Blokkeer CI bij regressies; bevestig online met A/B-tests en steekproeven

Evalueer altijd op een apart gehouden dataset in de ontwikkel- of stagingomgeving voordat je naar productie uitrolt.

Fragment uit het bestand dat je echt downloadt.

// zo installeer je Minder dan 2 minuten

Vier stappen. Elke AI-chat.

  1. 01
    Download het bestand

    Na het afrekenen komt de downloadlink in je inbox terecht. Sla het bestand ergens op je apparaat op.

  2. 02
    Open je AI-chat

    Claude, ChatGPT, Gemini, Grok of Copilot - welke je ook al gebruikt.

  3. 03
    Plak de inhoud van het bestand

    Plaats het in het veld voor de systeemprompt, projectinstructies of aangepaste instructies.

  4. 04
    Begin met werken

    Je AI is nu geconfigureerd als specialist. Stel hem alles wat binnen zijn vakgebied valt.

Geen technische kennis vereist. Geen abonnement. Eenmalig betalen, voor altijd gebruiken.

// compatibel met

Werkt met elke grote AI-chatbot.

Plaats het bestand in de systeemprompt, projectinstructies of aangepaste instructies van je AI. Geen configuratie. Geen code. Geen vendor lock-in.

What buyers say across KissMySkills

This skill has no reviews of its own yet. These are real reviews of other KissMySkills skills, built the same way.

  • ★★★★★
    operations lead at a growing startup. we needed consistency across the team. this gave us a shared baseline to work from.

    Lukas B. on Nadia — Email Marketing Specialist

  • ★★★★★
    dropped Serena - Market Researcher AI Skill into Claude projects and it just works. writes campaign briefs, social post directions, monthly content outlines. the output doesnt need much editing which is the main thing.

    Sarah K. on Serena — Market Researcher

  • ★★★★★
    cfo at a professional services firm. the output structure matched what our board expects.

    Jan Z. on Nadia — Email Marketing Specialist

  • ★★★★★
    product designer. needed a structured communication layer for cross-functional work. this provides it.

    Ewa A. on Serena — Market Researcher

  • ★★★★★
    investment analyst. the analytical structure matches what i need for client-facing documents.

    Joanna Y. on Diane — Executive Assistant

  • ★★★★★
    hr business partner at a 200-person organisation. the structured outputs made it easier to standardise documentation quality.

    Rachel M. on Nadia — Email Marketing Specialist

// faq

Vragen over dit product

Wat doet de Ingrid-skill?+

Evalueer LLM-apps: golden sets, LLM-as-judge, RAG- en agent-metrieken en een CI-gate die regressies blokkeert. Laad de skill één keer in Claude Projects en je krijgt een geconfigureerde LLM Evaluation Engineer zonder aan het begin van elke sessie de context opnieuw uit te leggen. Bouw en evalueer aan de hand van een gereserveerde testset in een ontwikkel- of stagingomgeving, voeg guardrails, kosten- en snelheidslimieten en menselijke beoordeling toe, en rol uit achter evals en monitoring voordat je agents of LLM-functies in productie aanbiedt.

Hoe installeer ik dit skillbestand?+

Download het .skill-pakket (het bevat SKILL.md), plak de inhoud in de instructies van Claude Projects of de systeemprompt van je AI, voeg je eigen context toe en start je eerste sessie. Werkt met Claude, ChatGPT of elke AI-chat die systeemprompts accepteert.

Met welke AI-tools werkt deze skill?+

Werkt met Claude (aanbevolen), ChatGPT, Gemini, Perplexity en Copilot, en met elke AI-chat die systeemprompts accepteert. Claude Projects geeft de beste resultaten.

Wat zit er in deze download?+

Eén .skill-pakket dat direct na aankoop wordt geleverd: de volledige rolconfiguratie in SKILL.md plus een bestand met een uitgewerkt voorbeeld en een realistisch scenario, zodat je de kwaliteit kunt zien voordat je erop vertrouwt. Geen abonnement, permanent van jou.

Wat is het verschil met Claude gebruiken zonder de Ingrid-skill?+

Zonder skillbestand begint je AI elke sessie als algemene assistent. Met Ingrid geladen past het vanaf het eerste bericht de methodologie van een LLM Evaluation Engineer toe, met elke keer consistente kwaliteit. Bouw en evalueer aan de hand van een gereserveerde testset in een ontwikkel- of stagingomgeving, voeg guardrails, kosten- en snelheidslimieten en menselijke beoordeling toe, en rol uit achter evals en monitoring voordat je agents of LLM-functies in productie aanbiedt.

Moet ik het zelf lezen?+

Nee. Het bestand is geschreven voor je AI om te lezen, niet voor jou. Upload het of plak het één keer in en de AI neemt de rol op zich. Daarna stel je gewoon vragen zoals je dat normaal zou doen. Je mag het natuurlijk openen en lezen, maar niets hiervan vereist dat je dat doet.

Is dit een fysiek boek?+

Nee, het is digitaal. Je downloadt het zodra de bestelling is afgerond en het blijft permanent van jou. De omslag is vormgegeven als een boek omdat elke editie als één zelfstandig werk is geschreven en geredigeerd. Het lezen is de taak van je AI, niet die van jou.

Klaar om je AI te specialiseren?

Eén bestand dat je direct kunt gebruiken. Betaal één keer, houd het voor altijd - werkt met Claude en ChatGPT.

Meer van deze plank

Chatbot Builder Skill for Discord

Chatbot Builder Skill for Discord

Chatbot Builder Skill for Discord

$29.00
Aanbiedingsprijs  $29.00 Normale prijs 
Chatbot Builder Skill for WhatsApp

Chatbot Builder Skill for WhatsApp

Chatbot Builder Skill for WhatsApp

$29.00
Aanbiedingsprijs  $29.00 Normale prijs 
Chatbot Builder Skill for Telegram

Chatbot Builder Skill for Telegram

Chatbot Builder Skill for Telegram

$29.00
Aanbiedingsprijs  $29.00 Normale prijs 
Chatbot Builder Skill for WordPress

Chatbot Builder Skill for WordPress

Chatbot Builder Skill for WordPress

$14.99
Aanbiedingsprijs  $14.99 Normale prijs