langsmith-code-eval

tarafından langchain-ai

LangSmith ile izlenen ajanlar için kod tabanlı değerlendiriciler oluşturur. Özel değerlendirme mantığı oluştururken, araç kullanım desenlerini test ederken veya ajan çıktılarını puanlarken kullanın…

npx skills add https://github.com/langchain-ai/lca-skills --skill langsmith-code-eval

LangSmith Code Evaluator Creation

Creates evaluators for LangSmith experiments through structured inspection and implementation.

Prerequisites

  • langsmith Python package installed
  • LANGSMITH_API_KEY environment variable set (check project's .env file)

Workflow

Copy this checklist and track progress:

Evaluator Creation Progress:
- [ ] Step 1: Gather info from user
- [ ] Step 2: Inspect trace and dataset structure
- [ ] Step 3: Read agent code
- [ ] Step 4: Write evaluator
- [ ] Step 5: Write experiment runner
- [ ] Step 6: Run and iterate

Step 1: Gather Info from User

IMPORTANT: Do NOT search or explore the codebase. Ask the user all of these questions upfront using AskUserQuestion before doing anything else.

Ask the user the following in a single AskUserQuestion call:

  1. Python command: How do you run Python in this project? (e.g., python, python3, uv run python, poetry run python)
  2. Agent file path: What is the path to your agent file?
  3. LangSmith project name: What is your LangSmith project name (where traces are logged)?
  4. LangSmith dataset name: What is the name of the dataset to evaluate against?
  5. Evaluation goal: What behavior should pass vs fail? Common types:
    • Tool usage: Did the agent call the correct tool?
    • Output correctness: Does output match expected format/content?
    • Policy compliance: Did it follow specific rules?
    • Classification: Did it categorize correctly?

Step 2: Inspect Trace and Dataset Structure

Using the info from Step 1, run the inspection scripts located in this skill's directory:

{python_cmd} {skill_dir}/scripts/inspect_trace.py PROJECT_NAME [RUN_ID]
{python_cmd} {skill_dir}/scripts/inspect_dataset.py DATASET_NAME

Replace {python_cmd} with the command from Step 1, and {skill_dir} with this skill's directory path.

Verify the trace matches the agent:

  • Does the trace type match? (e.g., OpenAI trace for OpenAI agent)
  • Does it contain the data needed for evaluation?
  • If mismatched, clarify before proceeding.

From the dataset inspection, note:

  • Input schema (what gets passed to the agent)
  • Output schema (reference/expected outputs)
  • Metadata fields (e.g., expected_tool, difficulty, labels)

The dataset metadata often contains ground truth for evaluation (e.g., which tool should be called, expected classification).

Step 3: Read Agent Code

Read the agent file provided in Step 1 to identify:

  • Entry point function (look for @traceable decorator)
  • Available tools
  • Output format (what the function returns)

Step 4: Write the Evaluator

Create evaluator functions based on trace and dataset structure. See EVALUATOR_REFERENCE.md for function signatures and return formats.

Step 5: Write Experiment Runner

Create a script that:

  1. Imports the agent's entry function
  2. Wraps it as a target function
  3. Runs evaluate() or aevaluate() against the dataset

See EVALUATOR_REFERENCE.md for evaluate() usage.

Step 6: Run and Iterate

Execute the experiment, review results in LangSmith, refine evaluators as needed.

langchain-ai tarafından daha fazla skill

langgraph-docs
langchain-ai
LangGraph dokümantasyonuna erişerek durum bilgisi olan ajanlar ve çoklu ajan iş akışları oluşturun. Resmi LangGraph Python dokümanlarını getirir; durum makineleri, grafik tabanlı ajan tasarımı ve insan-döngüde desenlerini kapsar. Sorgu türüne göre ilgili dokümantasyonu önceliklendirir: nasıl yapılır soruları için uygulama kılavuzları, teori için kavram sayfaları, uçtan uca örnekler için eğitimler ve teknik detaylar için API referansları. En alakalı 2–4 dokümantasyon URL'sini otomatik olarak seçer ve yanıtlamak için içeriklerini alır...
official
langgraph-human-in-the-loop
langchain-ai
Graf yürütmesini insan incelemesi, onayı veya doğrulaması için duraklatır, ardından girdileriyle devam eder. Üç bileşen gerektirir: bir checkpointer (InMemorySaver veya PostgresSaver), config içinde bir thread ID ve JSON-serializable interrupt payload'ları. interrupt(value) duraklatır ve verileri yüzeye çıkarır; Command(resume=value) devam ettirir ve bu değeri duraklatılan düğüme döndürür. interrupt() öncesindeki tüm kod devamda yeniden çalıştırılır, bu nedenle yan etkiler idempotent olmalıdır (insert değil upsert kullanın). Onay iş akışlarını destekler,...
official
web-research
langchain-ai
Web araştırması ile ilgili talepler için bu beceriyi kullanın; kapsamlı web araştırması yapmak için yapılandırılmış bir yaklaşım sunar.
official
langchain-oss-primer
langchain-ai
Herhangi bir LangChain, Deep Agents veya LangGraph ajan oluşturma projesine BAŞLANGIÇ NOKTASI. Diğer becerileri seçmeden veya herhangi bir şey yazmadan önce gerekli başlangıç noktası.
official
skill-creator
langchain-ai
Etkili beceriler oluşturmak için rehber; bu beceriler, uzmanlaşmış bilgi, iş akışları veya araç entegrasyonları ile ajan yeteneklerini genişletir. Kullanıcı…
official
social-media
langchain-ai
Platformaya özel sosyal medya gönderilerini, araştırma destekli içerik ve oluşturulan eşlik eden görsellerle hazırlar. LinkedIn gönderilerini (profesyonel tonla 1.300 karakter) ve Twitter/X thread'lerini (tweet başına 280 karakter, 1/🧵 formatı) destekler. Yazmadan önce araştırmayı bir alt ajana devretmeyi, ardından doğruluk ve alaka düzeyini sağlamak için bulguları okumayı gerektirir. generate_social_image aracıyla, küçük... için optimize edilmiş cesur, yüksek kontrastlı kompozisyonlarla otomatik olarak dikkat çekici sosyal görseller oluşturur.
official
deep-agents-memory
langchain-ai
Deep Agents için geçici, kalıcı ve hibrit yönlendirme seçeneklerine sahip takılabilir bellek ve dosya arka uçları. Dört arka uç türü: StateBackend (iş parçacığı kapsamlı, geçici), StoreBackend (oturumlar arası kalıcı), FilesystemBackend (yerel geliştirme için gerçek disk erişimi) ve CompositeBackend (farklı yolları farklı arka uçlara yönlendirir). FilesystemMiddleware altı dosya işleme aracı sağlar: ls, read_file, write_file, edit_file, glob, grep. CompositeBackend en uzun önek eşlemesini kullanarak yönlendirme yapar...
official
deep-agents-orchestration
langchain-ai
Alt ajanları yönetir, çok adımlı görevleri planlar ve hassas işlemler için insan onayı gerektirir. Görev aracı aracılığıyla uzmanlaşmış alt ajanlara iş dağıtır; özel alt ajanlar izole araç setlerini ve sistem yönlendirmelerini desteklerken, varsayılan "genel amaçlı" alt ajan ana ajan yapılandırmasını devralır. write_todos ile karmaşık iş akışlarını planlayıp takip eder, görevleri beklemede, devam eden ve tamamlanmış durumlar arasında düzenler; kalıcılık için bir thread_id gerektirir. Uygular...
official