LLMOps / Inference Engineer Claude skill by KissMySkills, hardcover volume cover

Dario - Skill de Engenheiro de LLMOps AI

$29.00
Preço promocional  $29.00 Preço normal  $43.99
Ir para as informações do produto
LLMOps / Inference Engineer Claude skill by KissMySkills, hardcover volume cover

Dario - Skill de Engenheiro de LLMOps AI

$29.00 this skill vs $43.99 hiring a senior LLMOps engineer

Complete skill package instant downloaddario-llmops-inference-engineer.skill

Choose how to get it

  • American Express
  • Apple Pay
  • BLIK
  • Google Pay
  • Klarna
  • Maestro
  • Mastercard
  • PayPal
  • Union Pay
  • Visa

Secure checkout by Shopify

Download instantâneo Guardar para sempre Escrito por nós

Add it once. Your AI works like a specialist.

Adicione ao Claude, ChatGPT ou Gemini - sua AI funciona como especialista nessa área.

Download instantâneo · garantia de reembolso de 30 dias. Pague uma vez, use para sempre - sem assinatura. Escrito e testado por nós, nunca extraído do GitHub. Política de reembolso

Ask Dario something hard.

📎 dario-llmops-inference-engineer.md LOADED ✓
Self-hosted Llama on 4 A100s: throughput fine at noon, p99 latency triples at peak. Batch size? Engine? Where do I look?
CLAUDE · AS DARIO, SKILL DE ENGENHEIRO DE LLMOPS AI p99 tripling while throughput holds is queue depth, not compute - split time-in-queue from time-in-inference in your metrics first. Continuous batching via vLLM or TGI fixes head-of-line blocking if you're on a static-batch server, and paged KV-cache stops the fragmentation that forces preemptions. Then set explicit SLOs - TTFT under 500ms, inter-token under 50ms - and scale or shed on queue depth, not GPU utilization; GPUs report busy while requests rot in line. Already on vLLM? Check max_num_seqs against your context-length mix. What does the queue metric show at peak?

Dúvidas antes de comprar?

Escreva para nós e uma pessoa responderá - geralmente no mesmo dia. Não é um robô, nem uma fila de chamados.

hello@kissmyskills.com

Você não lê. Sua AI lê.

Adicione o arquivo de habilidade ao Claude, ChatGPT ou Gemini uma única vez. A partir de então, ele funcionará como especialista nessa área e responderá como Dario já na mensagem seguinte.

Compre uma vez e o arquivo será seu para sempre. Ou assine o All-Access e deixe o conector KissMySkills carregá-lo, junto com todas as outras habilidades, no seu chat quando solicitado.

// what's inside

O que há dentro desta habilidade

  1. Inference tuning: continuous batching, KV-cache, quantization
  2. An LLM gateway: routing, fallbacks, retries, rate limits
  3. Capacity math, autoscaling and prefix/semantic caching
  4. Observability (TTFT, p95, cost/req), SLOs and canary rollout

Teams putting LLM features in production who need latency, reliability and cost under control.

A senior LLMOps engineer bills $140+/hr, the complete skill is yours forever.

// what's inside

What you're actually buying

Adicione o Dario ao Claude e tenha um engenheiro sênior de LLMOps que opera seu modelo como um serviço gerenciado por SRE: SLOs, um gateway, dashboards e reversão com uma etapa.

Dario disponibiliza e opera LLMs em produção: mecanismos de inferência (vLLM, TGI, TensorRT-LLM), relação entre throughput e latência (batching contínuo, cache KV, atenção paginada, decodificação especulativa, trade-offs de quantização), um gateway de LLM (roteamento, alternativas, novas tentativas, timeouts, limites de taxa e cota, gerenciamento de chaves), escalonamento automático e planejamento de capacidade de GPU, cache (de prefixo e semântico), confiabilidade (disjuntores, failover entre vários provedores), observabilidade (p50/p95/p99, TTFT, tokens/seg., custo por solicitação, alertas) e implantação canário/sombra com SLOs e orçamentos de erro. Ferramentas como vLLM, LiteLLM, KServe, Prometheus, Grafana e Langfuse, sem dependência de um único fornecedor. Faça a implantação canário primeiro no staging.

O que você recebe

  • Otimização de inferência: batching contínuo, cache KV, quantização
  • Um gateway de LLM: roteamento, alternativas, novas tentativas e limites de taxa
  • Cálculos de capacidade, escalonamento automático e cache de prefixo/semântico
  • Observabilidade (TTFT, p95, custo/solicitação), SLOs e implantação canário
📄 dario-llmops-inference-engineer.skill Instalação em menos de 2 min Funciona com Claude, ChatGPT e qualquer chat de AI

Como instalar

Baixe o pacote .skill → abra o Claude → cole o SKILL.md nas Instruções do projeto ou no prompt do sistema → descreva sua necessidade → o Dario cria a resposta. Inclui um exemplo completo para você ver exatamente o que recebe.

dario-llmops-inference-engineer.skill
# Dario - LLMOps / Inference Engineer

You are Dario, a senior LLMOps / Inference Engineer. You run the model like an SRE-owned service: SLO first, dashboards, one-step rollback.

## How you work
1. Set the SLO; do the capacity math out loud
2. Serve efficiently (batching, KV-cache, quantization)
3. Front it with a gateway (routing, fallback, rate limits)
4. Add dashboards and alerts; roll out by canary; keep rollback

Always roll out via shadow/canary in staging first and keep a one-step rollback.

Exemplo do arquivo real que você baixará.

// how to install Em menos de 2 minutos

Quatro passos. Qualquer chat de AI.

  1. 01
    Baixar o arquivo

    Após a finalização da compra, o link para download chegará à sua caixa de entrada. Salve o arquivo em qualquer lugar do seu dispositivo.

  2. 02
    Abra seu chat de AI

    Claude, ChatGPT, Gemini, Grok ou Copilot - qualquer um que você já use.

  3. 03
    Cole o conteúdo do arquivo

    Cole isso no prompt do sistema, nas instruções do projeto ou no campo de instruções personalizadas.

  4. 04
    Comece a trabalhar

    Sua AI agora está configurada como especialista. Pergunte qualquer coisa dentro da área de especialização dela.

Nenhum conhecimento técnico necessário. Sem assinatura. Pague uma vez, use para sempre.

// compatible with

Funciona com todos os principais chats de AI.

Solte o arquivo no prompt de sistema da sua AI, nas instruções do projeto ou nas instruções personalizadas. Sem configuração. Sem código. Sem dependência de fornecedor.

// faq

Dúvidas sobre este produto

What does the Dario skill do?+

Operate LLMs in prod: serving, a gateway, autoscaling, caching, dashboards and SLO-gated rollout. Load it once into Claude Projects and you get a configured LLMOps / Inference Engineer without re-explaining context at the start of every session. Build and evaluate against a held-out test set in a development or staging environment, add guardrails, cost and rate limits, and human review, and roll out behind evals and monitoring before serving agents or LLM features in production.

How do I install this skill file?+

Download the .skill package (it contains SKILL.md), paste the contents into Claude Projects Instructions or your AI's system prompt, add your own context and start your first session. Works with Claude, ChatGPT, or any AI chat that accepts system prompts.

Which AI tools does this skill work with?+

Works with Claude (recommended), ChatGPT, Gemini, Perplexity and Copilot, and any AI chat that accepts system prompts. Claude Projects gives the best results.

What is included in this download?+

One .skill package delivered instantly after purchase: the full SKILL.md role configuration plus a worked-example file with a real scenario so you see the quality before you rely on it. No subscription, yours permanently.

How is this different from using Claude without the Dario skill?+

Without a skill file your AI starts every session as a general assistant. With Dario loaded it applies LLMOps / Inference Engineer methodology from the first message, with consistent quality every time. Build and evaluate against a held-out test set in a development or staging environment, add guardrails, cost and rate limits, and human review, and roll out behind evals and monitoring before serving agents or LLM features in production.

Do I have to read it myself?+

No. The file is written for your AI to read, not for you. Upload it or paste it in once and the AI takes on the role. After that you just ask it questions the way you normally would. You're welcome to open it and read it, but nothing here depends on you doing that.

Is this a physical book?+

No, it's digital. You download it the moment the order goes through and it's yours permanently. The cover is styled like a book because each edition is written and edited as one self-contained piece of work. The reading part is your AI's job, not yours.

Pronto para especializar sua AI?

Um único arquivo pronto para usar. Pague uma vez, use para sempre - funciona com Claude e ChatGPT.

Mais habilidades neste campo

Skill para criar chatbots para o Discord

Skill para criar chatbots para o Discord

Skill para criar chatbots para o Discord

$29.00
Preço promocional  $29.00 Preço normal 
Skill para criar chatbots para o WhatsApp

Skill para criar chatbots para o WhatsApp

Skill para criar chatbots para o WhatsApp

$29.00
Preço promocional  $29.00 Preço normal 
Skill para criar chatbots para o Telegram

Skill para criar chatbots para o Telegram

Skill para criar chatbots para o Telegram

$29.00
Preço promocional  $29.00 Preço normal 
Skill de construção de chatbots para WordPress

Skill de construção de chatbots para WordPress

Skill de construção de chatbots para WordPress

$14.99
Preço promocional  $14.99 Preço normal