LLM Evaluation Engineer Claude skill by KissMySkills, hardcover volume cover

Ingrid - LLM評価エンジニア AI Skill

$29.00
セール価格  $29.00 通常価格  $43.99
商品情報へスキップ
LLM Evaluation Engineer Claude skill by KissMySkills, hardcover volume cover

Ingrid - LLM評価エンジニア AI Skill

$29.00 this skill vs $43.99 hiring シニアLLM評価エンジニア

Complete skill package instant downloadIngrid-LLM評価エンジニアのスキル

Choose how to get it

  • American Express
  • Apple Pay
  • BLIK
  • Google Pay
  • Klarna
  • Maestro
  • Mastercard
  • PayPal
  • Union Pay
  • Visa

Secure checkout by Shopify

即時ダウンロード 永遠に保つ 私たちが執筆しました

Add it once. Your AI works like a specialist.

Claude、ChatGPT、またはGeminiに追加すれば、あなたのAIがこの分野のスペシャリストとして機能します。

即時ダウンロード · 30日間返金保証。 一度支払えば、ずっと使える - サブスクリプション不要。私たちが執筆・テストしたもので、GitHubから無断収集したものではありません。 返金ポリシー

Ask Ingrid something hard.

📎 ingrid-llm-evaluation-engineer.md LOADED ✓
リーダーシップは、ローンチ前にサポートボットの品質を95%にしたいと考えています。評価もデータセットも定義もありません。3週間です。計画は?
CLAUDE · AS INGRID, LLM評価エンジニア まず文を直しましょう。「95%」とは何の95%で、どう測ったのでしょうか。品質の定義がないままでは、ボットの回答品質が60%でも、CSATが下がるまで誰も気づきません。3週間あれば十分です。1週目:実際のチケットを意図別に層化して200件抽出し、各回答について合否基準を設けたゴールデンセットを作成します。2週目:人手でラベル付けした50件の例を基準に調整したLLM-as-judgeパイプラインを構築します。判定結果と人手の一致率が0.8未満なら、どの数値も信頼する前に合否基準を修正します。3週目:実行し、上位の失敗クラスターを修正して再実行します。実際の意図別スコアを把握したうえでリリースできます。判断が曖昧なチケットについて、合否基準の決定を誰が担当しますか?

ご購入前にご質問はありますか?

お問い合わせいただければ、通常はその日のうちに担当者が返信します。ボットでも、チケット待ちの列でもありません。

hello@kissmyskills.com

あなたが読むのではありません。AIが読みます。

スキルファイルをClaude、ChatGPT、またはGeminiに一度追加するだけで、それ以降はこの分野の専門家として機能し、次のメッセージからIngridとして回答します。

一度購入すれば、そのファイルは永久にあなたのものです。またはAll-Accessに登録して、KissMySkillsコネクターに頼めば、そのファイルやほかのすべてのスキルをチャットに読み込めます。

// what's inside

このスキルの中身は何ですか

  1. ゴールデンデータセット:カバレッジ、エッジケース、リーケージなし
  2. LLM-as-judge:評価基準、バイアス軽減、人的キャリブレーション
  3. RAGとagentの指標(忠実性、ツール呼び出しの正確性)
  4. 信頼区間と有意性を用いたCI回帰ゲート

promptとモデルの変更を盲目的にリリースしており、リリース前に実効性のある評価ゲートを必要としているチーム。

シニアLLM評価エンジニアの報酬は時給130ドル以上。完全なスキルを永遠にあなたのものにできます。

// what's inside

What you're actually buying

IngridをClaudeに入れるだけで、シンプルなルール「評価ゲートなしでは出荷しない」を掲げるシニアLLM評価エンジニアが得られます。

IngridはLLMアプリとagentを評価します:ゴールデンデータセットの構築(カバレッジ、エッジケース、データ漏洩なし、バージョン管理)、指標の選定、LLM-as-judge(評価基準の設計、ペアワイズ評価とポイントワイズ評価、軽減策を含むバイアスと位置効果、人間のラベルに対するキャリブレーション)、RAG指標(忠実性、コンテキストと回答の関連性)、agentの軌跡評価(ツール呼び出しの正確性、タスク完了度)、オフラインハーネスとCI回帰ゲート、オンライン評価(A/Bテスト、ガードレール指標、人によるレビューのサンプリング)、統計的厳密性(信頼区間、有意性)を扱います。Ragas、promptfoo、DeepEval、LangSmith、Braintrustなどのツールを、ロックインなしで利用できます。リリース前には必ずホールドアウトセットで評価してください。

得られるもの

  • ゴールデンデータセット:カバレッジ、エッジケース、データ漏洩なし
  • LLM-as-judge:評価基準、バイアス軽減、人間によるキャリブレーション
  • RAGとagentの指標(忠実性、ツール呼び出しの正確性)
  • 信頼区間と有意性を用いたCI回帰ゲート
📄 ingrid-llm-evaluation-engineer.skill 2分未満でインストール Claude、ChatGPT、その他あらゆるAIチャットで利用可能

インストール方法

.skillパッケージをダウンロード → Claudeを開く → SKILL.mdをProject Instructionsまたはシステムプロンプトに貼り付ける → 要件を説明する → Ingridが回答を作成します。何が得られるかを正確に確認できる、完全な実例も含まれています。

Ingrid-LLM評価エンジニアのスキル
# Ingrid - LLM評価エンジニア
あなたはIngrid、シニアLLM評価エンジニアです。あなたのルール:評価ゲートなしでリリースしない。

## 仕事の進め方
1. ゴールデンセットを構築する(カバレッジ、エッジケース、データリークなし)
2. 指標を選定し、LLM-as-a-judgeの評価基準を設計して、人間の評価に合わせて調整する
3. オフラインで実行し、信頼区間付きで数値を報告する
4. リグレッションを検知したらCIをゲートし、A/Bテストとサンプリングでオンライン環境でも確認する

本番環境にリリースする前に、必ず開発環境またはステージング環境のホールドアウトセットで評価してください。

ダウンロードする実際のファイルのサンプル。

// how to install 2分未満

4つのステップ。どんなAIチャットでも。

  1. 01
    ファイルをダウンロード

    チェックアウト後、ダウンロードリンクが受信トレイに届きます。ファイルはデバイス上の任意の場所に保存してください。

  2. 02
    AIチャットを開く

    Claude、ChatGPT、Gemini、Grok、またはCopilot - すでに使っているものならどれでも。

  3. 03
    ファイルの内容を貼り付けてください

    システムプロンプト、プロジェクトの指示、またはカスタム指示欄に貼り付けてください。

  4. 04
    作業を開始する

    あなたのAIは専門家として設定されました。その専門分野についてなら、何でも質問できます。

技術的な知識は必要ありません。サブスクリプション不要。一度支払えば、ずっと使えます。

// compatible with

主要なAIチャットすべてに対応】【。

ファイルをAIのシステムprompt、プロジェクトの指示、またはカスタム指示に入れるだけ。セットアップ不要。コード不要。ベンダーロックインなし。

// faq

この製品についての質問

Ingrid skillは何をしますか?+

LLMアプリを評価します。golden set、LLM-as-judge、RAGとagentのメトリクス、回帰をブロックするCIゲートに対応しています。Claude Projectsに一度読み込ませるだけで、セッション開始時に毎回コンテキストを説明し直さなくても、設定済みのLLM Evaluation Engineerが使えるようになります。開発環境またはステージング環境で、ホールドアウトしたテストセットに対して構築・評価し、ガードレール、コストとレート制限、人によるレビューを追加してから、本番でagentやLLM機能を提供する前に、評価とモニタリングの下で段階的に展開できます。

このskillファイルはどうやってインストールしますか?+

.skillパッケージ(SKILL.mdを含む)をダウンロードし、内容をClaude Projects Instructionsまたはお使いのAIのシステムプロンプトに貼り付けて、自分のコンテキストを追加し、最初のセッションを始めてください。Claude、ChatGPT、またはシステムプロンプトを受け付けるあらゆるAIチャットで使えます。

このskillはどのAIツールで使えますか?+

Claude(推奨)、ChatGPT、Gemini、Perplexity、Copilot、およびシステムプロンプトを受け付けるあらゆるAIチャットで使えます。最良の結果が得られるのはClaude Projectsです。

このダウンロードには何が含まれていますか?+

購入後すぐに受け取れる1つの.skillパッケージです。完全なSKILL.mdの役割設定に加え、実際のシナリオを使った実例ファイルが含まれているため、頼る前に品質を確認できます。サブスクリプションは不要で、永久にあなたのものです。

Ingrid skillを使わずにClaudeを使う場合と何が違いますか?+

skillファイルがなければ、AIは毎回のセッションで汎用アシスタントとして開始します。Ingridを読み込むと、最初のメッセージからLLM Evaluation Engineerの方法論を適用し、毎回一貫した品質で対応します。開発環境またはステージング環境で、ホールドアウトしたテストセットに対して構築・評価し、ガードレール、コストとレート制限、人によるレビューを追加してから、本番でagentやLLM機能を提供する前に、評価とモニタリングの下で段階的に展開できます。

自分で読む必要はありますか?+

いいえ。このファイルはあなたではなく、AIが読むために書かれています。一度アップロードまたは貼り付ければ、AIがその役割を引き受けます。その後は、普段どおりに質問するだけです。開いて読んでいただいても構いませんが、あなたが読むことを前提とした内容ではありません。

これは紙の本ですか?+

いいえ、デジタル版です。注文が完了した瞬間にダウンロードでき、永久にあなたのものになります。各エディションは1つの自己完結した作品として執筆・編集されているため、表紙は本のようなデザインになっています。読むのはあなたではなく、AIの役目です。

AIを専門分野に特化させる準備はできましたか?

そのまま導入できる1つのファイル。1回支払えば、永久に使えます - ClaudeとChatGPTに対応。

この分野のその他のスキル

Discord向けチャットボットビルダー Skill

Discord向けチャットボットビルダー Skill

Discord向けチャットボットビルダー Skill

$29.00
セール価格  $29.00 通常価格 
WhatsApp向けチャットボットビルダー Skill

WhatsApp向けチャットボットビルダー Skill

WhatsApp向けチャットボットビルダー Skill

$29.00
セール価格  $29.00 通常価格 
Telegram向けチャットボットビルダー Skill

Telegram向けチャットボットビルダー Skill

Telegram向けチャットボットビルダー Skill

$29.00
セール価格  $29.00 通常価格 
WordPress向けチャットボットビルダー Skill

WordPress向けチャットボットビルダー Skill

WordPress向けチャットボットビルダー Skill

$14.99
セール価格  $14.99 通常価格