HumanEval üzerinde DeepSeek-Coder-6.7B değerlendirmesi
python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval komutunu çalıştırın
Kimler için uygun:Model geliştiricileri
Kodlama / Geliştirici

DeepSeek Harness, deepseek-ai tarafından sürdürülen ve lm-evaluation-harness temelinde DeepSeek modelleri için kullanıma hazır değerlendirme betikleri ile görev yapılandırmaları sunan bir GitHub repository'sidir.
OpenRouter token kullanım sıralaması
#8
Kaynaklar: OpenRouter

Coding Plan
Coding Pro model indirimleri
Bu ürün Kodlama / Geliştirici kategorisinde yer alır ve temel olarak geliştiricilerin modelleri yerel olarak veya sunucularda dağıtıp kullanmasına yöneliktir. Repository'yi klonlayıp bağımlılıkları yükleyerek ve belirtilen komutları çalıştırarak DeepSeek serisi modeller üzerinde standart benchmark testleri çalıştırabilirsiniz. Temel güçlü yanı, repository'nin DeepSeek modelleri için uyarlama dosyalarını ve görev listelerini hazır olarak içermesidir; böylece kullanıcıların değerlendirme kodunu kendilerinin yazması gerekmez. Açık kaynaklı veya özel büyük modeller için tutarlı değerlendirmelere ihtiyaç duyan yapay zeka araştırmacıları ve mühendislik ekipleri için uygundur. Genel değerlendirme framework'leriyle karşılaştırıldığında DeepSeek model ağırlıklarının yüklenme yöntemleriyle doğrudan entegre olur ve model uyarlama adımını azaltır.
Tek satırlık özet
DeepSeek Harness, deepseek-ai tarafından sürdürülen ve lm-evaluation-harness temelinde DeepSeek modelleri için kullanıma hazır değerlendirme betikleri ile görev yapılandırmaları sunan bir GitHub repository'sidir.
Ne için kullanılır
Kullanıcılar python betiklerini çalıştırmak, MMLU ve HumanEval gibi veri kümelerinde belirli DeepSeek modellerini benchmark testine tabi tutmak ve skorları dışa aktarmak için kullanır. Ayrıca farklı model sürümleri veya checkpoint'ler arasındaki değerlendirme sonuçlarını toplu olarak karşılaştırmak için de kullanılır.
Kimler için uygun
Geliştiriciler, mühendislik ekipleri ve teknik liderler
Nasıl çalışır
Genellikle bir IDE'de, terminalde veya proje ortamında bağlamı okuyarak başlar. Ardından Agent adımları planlar, komutları çalıştırır veya dosyaları değiştirir; kullanıcı da sonuçları kontrol eder.
Ürün türü
Uzantı / Eklenti
Fiyatlandırma
Bilinmiyor
Mevcut geliştirilmiş toplu veri kümesi bu ürün için gerçek zamanlı fiyatlandırma bilgisi sunmuyor. Resmi web sitesine veya resmi dokümantasyona başvurun.
APIMaster entegrasyonu
Destekleniyor
DeepSeek Harness → Settings → Models → Add a custom provider
Veri güvenilirliği
Orta
Son doğrulama: 2026-09-02
HumanEval veri kümesini yükleyin, model kod üretimini çalıştırın ve pass@1, pass@10 ile pass@100 metriklerini hesaplayın
Toplu inference için modelleri vLLM engine üzerinden yükleyin; tensor parallelism ve continuous batching desteğinden yararlanın
Görev adlarını, veri kümesi yollarını, prompt şablonlarını ve değerlendirme metriklerini tanımlamak için YAML dosyalarını kullanın
Her örneğe ait ayrıntılı sonuçları ve genel metrikleri içeren JSON dosyaları oluşturun
DeepSeek-Coder serisi model ağırlıklarını doğrudan Hugging Face Hub üzerinden yükleyin
Otomatik indirme ve ön işleme desteği sunan, yerleşik MBPP ve APPS kod üretimi görevlerinden yararlanın
python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval komutunu çalıştırın
Kimler için uygun:Model geliştiricileri
Aynı benchmark testlerini sırasıyla deepseek-coder-6.7b-base ve deepseek-coder-v2-lite-base üzerinde çalıştırın ve pass@k değerini karşılaştırın
Kimler için uygun:Araştırmacılar
Dahili bir kod repository'sine işaret eden bir YAML yapılandırması yazın, ardından modelin belirli bir programlama dilindeki performansını doğrulamak için değerlendirmeyi çalıştırın
Kimler için uygun:Kurumsal geliştiriciler
Birden fazla model üzerinde MBPP ve HumanEval'i aynı anda çalıştırmak ve karşılaştırma raporları oluşturmak için vLLM backend'ini yapılandırın
Kimler için uygun:Yapay zeka mühendisleri
Base URL
https://apimaster.ai/v1API anahtarı ortam değişkeni
API key(Custom provider 配置项)Model
gpt-5.6-sol veya claude-sonnet-4-6 veya deepseek-v4-proTartışma özeti
Kullanıcılar DeepSeek Harness'ı genellikle "her şey bir eklentidir" temel fikri etrafında oluşturulmuş, yüksek düzeyde modüler bir yapay zeka kodlama aracısı orkestrasyon framework'ü olarak değerlendirir. Bu yaklaşım; modeller, araçlar, oturum günlükleri, aracı döngüleri ve alt aracılar gibi bileşenlerin yapılandırma veya özel eklentiler aracılığıyla serbestçe değiştirilmesine olanak tanır. Tartışmalar, kişiselleştirilmiş iş akışları oluşturmak, yerel modellerle veya Claude Code ve Codex gibi üçüncü taraf aracılarla entegre olmak ve gerçek kodlama görevlerinde esneklik ile kararlılığı dengelemek için eklenti mimarisinin nasıl kullanılacağına odaklanır. Kullanıcılar ayrıca Pi ve Hermes gibi benzer araçlarla arasındaki mimari farkları da sıkça ele alır; özellikle eklenti tabanlı genişletmelerin işlevleri farklı senaryolara nasıl uyarlayabildiğine dikkat ederler.
Kullanıcılar; model adaptörleri, araç kaydı, oturum günlükleri ve aracı döngüleri gibi temel parçaların, framework kaynak kodu değiştirilmeden eklentiler tarafından bildirilen bağımlılıklar, event listener'lar ve geri alınabilir kayıt işlemleri aracılığıyla sorunsuz şekilde değiştirilebilmesini tartışıyor.
Kullanıcılar DeepSeek Harness'ın tamamen eklenti tabanlı, Lego tarzı tasarımını Pi'nin minimalist temeli veya Claude Code'un CLI deneyimiyle karşılaştırıyor; bağlam yönetimi, maliyet kontrolü ve özelleştirme özgürlüğü arasındaki ödünleşimleri ve farklı iş akışlarına hangi senaryoların uyduğunu inceliyor.
Kullanıcılar, Claude Code veya Codex gibi araçları yerel alt aracılar olarak bağlamaya, alt görevleri yönlendirmeye ve çok aracılı iş birliğini orkestre etmek için yapılandırma üzerinden durum ile ilerlemeyi kontrol etmeye odaklanıyor.
Kullanıcılar Ollama ve Qwen gibi yerel modelleri Harness'a bağlama, web araçları ve iOS otomasyonu gibi araç eklentileri ekleme ve ürünü yerel bir Web UI içinde çalıştırıp genişletme konusundaki kurulum ve yapılandırma deneyimlerini paylaşıyor.
Kullanıcılar topluluk eklenti dizinini kullanmayı, bellek, sandbox veya arayüz yeteneklerini genişletmek için yeni eklentiler yazmayı ve eklenti API'sinin kararlılığının uzun vadeli özel aracı geliştirmesini nasıl etkilediğini tartışıyor.
Ürünü şu anda "Kodlama / Geliştirici" kategorisinde sınıflandırıyoruz. Sayfadaki açıklama, resmi web sitesi ve OpenRouter gibi herkese açık kaynaklara dayanmaktadır.
DeepSeek Harness için hazırlanan geliştirilmiş sayfa, daha önce derlenmiş temel görevleri ve kullanım alanlarını öne çıkararak mevcut ihtiyaçlarınıza uygun olup olmadığını hızlıca değerlendirmenize yardımcı olur.
Mevcut materyaller, ürünün üçüncü taraf anahtarlarını veya özel uyumlu endpoint'leri desteklediğini doğruluyor. Bu nedenle doğrulamaya doğrudan sayfadaki yapılandırma talimatlarına göre devam edebilirsiniz.
O da Kodlama / Geliştirici kategorisinde yer alır; farklı görev giriş noktalarını ve ürün biçimlerini yan yana karşılaştırmak için uygundur.
O da Kodlama / Geliştirici kategorisinde yer alır; farklı görev giriş noktalarını ve ürün biçimlerini yan yana karşılaştırmak için uygundur.
O da Kodlama / Geliştirici kategorisinde yer alır; farklı görev giriş noktalarını ve ürün biçimlerini yan yana karşılaştırmak için uygundur.
Kaynaklar:Resmî web sitesiResmî belgelerGitHub
Son doğrulama: 2026-09-02 · Düzeltme bildir