Ewaluacja DeepSeek-Coder-6.7B na HumanEval
Uruchom python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval
Dla kogo:Twórcy modeli
Programowanie / Deweloperzy

DeepSeek Harness to repozytorium GitHub utrzymywane przez deepseek-ai, które udostępnia gotowe skrypty ewaluacyjne i konfiguracje zadań dla modeli DeepSeek na podstawie lm-evaluation-harness.
Ranking zużycia tokenów OpenRouter
#8
Źródła: OpenRouter

Coding Plan
Rabaty na modele Coding Pro
Ten produkt należy do kategorii Coding / Developer i jest przeznaczony głównie dla deweloperów, którzy wdrażają go i używają lokalnie lub na serwerach. Po sklonowaniu repozytorium, zainstalowaniu zależności i uruchomieniu określonych poleceń użytkownicy mogą wykonywać standardowe testy benchmarkowe na modelach z serii DeepSeek. Jego główną zaletą jest to, że repozytorium zawiera już pliki adaptacyjne i listy zadań dla modeli DeepSeek, dzięki czemu użytkownicy nie muszą samodzielnie pisać kodu ewaluacyjnego. Produkt sprawdzi się w przypadku badaczy AI i zespołów inżynieryjnych, które potrzebują spójnej oceny otwartoźródłowych lub własnościowych dużych modeli. W porównaniu z ogólnymi frameworkami ewaluacyjnymi bezpośrednio integruje się z metodami ładowania wag modeli DeepSeek, ograniczając etap adaptacji modelu.
Jednozdaniowe podsumowanie
DeepSeek Harness to repozytorium GitHub utrzymywane przez deepseek-ai, które udostępnia gotowe skrypty ewaluacyjne i konfiguracje zadań dla modeli DeepSeek na podstawie lm-evaluation-harness.
Do czego służy
Użytkownicy korzystają z niego do uruchamiania skryptów Python, testowania konkretnych modeli DeepSeek na zbiorach danych takich jak MMLU i HumanEval oraz generowania wyników. Mogą również porównywać partiami wyniki ewaluacji różnych wersji modeli lub checkpointów.
Dla kogo
Deweloperzy, zespoły inżynieryjne i liderzy techniczni
Jak działa
Zwykle działanie rozpoczyna się od odczytania kontekstu w IDE, terminalu lub środowisku projektu. Następnie Agent planuje kolejne kroki, wykonuje polecenia lub modyfikuje pliki, a użytkownik sprawdza rezultaty.
Typ produktu
Rozszerzenie / wtyczka
Cennik
Nieznane
Aktualny rozszerzony zbiór danych nie zawiera informacji o cenach tego produktu w czasie rzeczywistym. Sprawdź oficjalną stronę internetową lub oficjalną dokumentację.
Integracja z APIMaster
Obsługiwane
DeepSeek Harness → Settings → Models → Add a custom provider
Wiarygodność danych
Średnia
Ostatnia weryfikacja: 2026-09-02
Wczytuj zbiór danych HumanEval, uruchamiaj generowanie kodu przez model i obliczaj metryki pass@1, pass@10 oraz pass@100
Wczytuj modele za pośrednictwem silnika vLLM do inferencji wsadowej, z obsługą zrównoleglenia tensorów i ciągłego tworzenia batchy
Korzystaj z plików YAML do definiowania nazw zadań, ścieżek do zbiorów danych, szablonów promptów i metryk ewaluacyjnych
Generuj pliki JSON zawierające szczegółowe wyniki dla każdej próbki oraz metryki ogólne
Wczytuj bezpośrednio z Hugging Face Hub wagi modeli z serii DeepSeek-Coder
Korzystaj z wbudowanych zadań generowania kodu dla MBPP i APPS oraz automatycznego pobierania i wstępnego przetwarzania danych
Uruchom python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval
Dla kogo:Twórcy modeli
Uruchom te same testy benchmarkowe odpowiednio na deepseek-coder-6.7b-base i deepseek-coder-v2-lite-base, a następnie porównaj pass@k
Dla kogo:Badacze
Napisz konfigurację YAML wskazującą wewnętrzne repozytorium kodu, a następnie uruchom ewaluację, aby zweryfikować wydajność modelu w konkretnym języku programowania
Dla kogo:Deweloperzy korporacyjni
Skonfiguruj backend vLLM, aby jednocześnie uruchamiać MBPP i HumanEval na wielu modelach oraz generować raporty porównawcze
Dla kogo:Inżynierowie AI
Base URL
https://apimaster.ai/v1Zmienna środowiskowa klucza API
API key(Custom provider 配置项)Model
gpt-5.6-sol lub claude-sonnet-4-6 lub deepseek-v4-proPodsumowanie dyskusji
Użytkownicy zwykle postrzegają DeepSeek Harness jako wysoce modułowy framework do orkiestracji agentów AI programujących, oparty na założeniu, że "wszystko jest wtyczką". Dzięki temu komponenty takie jak modele, narzędzia, dzienniki sesji, pętle agentów i subagenci mogą być swobodnie zastępowane za pomocą konfiguracji lub niestandardowych wtyczek. Dyskusje koncentrują się na wykorzystaniu architektury wtyczek do tworzenia spersonalizowanych przepływów pracy, integracji z modelami lokalnymi lub zewnętrznymi agentami, takimi jak Claude Code i Codex, oraz na równoważeniu elastyczności i stabilności w rzeczywistych zadaniach programistycznych. Użytkownicy często omawiają również różnice architektoniczne względem podobnych narzędzi, takich jak Pi i Hermes, zwracając uwagę na to, jak rozszerzenia oparte na wtyczkach mogą dostosowywać funkcje do różnych scenariuszy.
Użytkownicy omawiają, jak podstawowe elementy, takie jak adaptery modeli, rejestracja narzędzi, dzienniki sesji i pętle agentów, mogą być płynnie zastępowane za pomocą zależności deklarowanych przez wtyczki, odbiorników zdarzeń i odwracalnej rejestracji, bez modyfikowania kodu źródłowego frameworka.
Użytkownicy porównują w pełni opartą na wtyczkach, modułową niczym klocki Lego konstrukcję DeepSeek Harness z minimalistyczną bazą Pi lub obsługą CLI w Claude Code, analizując kompromisy dotyczące zarządzania kontekstem, kontroli kosztów i swobody dostosowywania oraz dopasowanie poszczególnych rozwiązań do różnych przepływów pracy.
Użytkownicy skupiają się na łączeniu narzędzi takich jak Claude Code lub Codex jako natywnych subagentów, kierowaniu podzadań oraz sprawdzaniu stanu i postępów za pomocą konfiguracji w celu orkiestracji współpracy wielu agentów.
Użytkownicy dzielą się doświadczeniami z instalacją i konfiguracją połączeń lokalnych modeli, takich jak Ollama i Qwen, z Harness, dodawaniem wtyczek narzędziowych, takich jak narzędzia webowe i automatyzacja iOS, oraz uruchamianiem i rozszerzaniem rozwiązania w lokalnym Web UI.
Użytkownicy omawiają korzystanie z katalogu wtyczek społeczności, tworzenie nowych wtyczek rozszerzających możliwości pamięci, piaskownicy lub interfejsu użytkownika oraz wpływ stabilności API wtyczek na długoterminowy rozwój niestandardowych agentów.
Obecnie klasyfikujemy go w kategorii "Coding / Developer", a opis strony opiera się na publicznych źródłach, takich jak oficjalna strona internetowa i OpenRouter.
Rozszerzona strona DeepSeek Harness koncentruje się na zebranych już najważniejszych zadaniach i przypadkach użycia, pomagając szybko ocenić, czy produkt odpowiada Twoim obecnym potrzebom.
Dotychczasowe materiały potwierdzają, że produkt obsługuje klucze zewnętrzne lub niestandardowe kompatybilne endpointy, dlatego możesz kontynuować weryfikację bezpośrednio zgodnie z instrukcjami konfiguracji na stronie.
Również należy do kategorii Coding / Developer i nadaje się do bezpośredniego porównania różnych punktów wejścia zadań oraz formatów produktów.
Również należy do kategorii Coding / Developer i nadaje się do bezpośredniego porównania różnych punktów wejścia zadań oraz formatów produktów.
Również należy do kategorii Coding / Developer i nadaje się do bezpośredniego porównania różnych punktów wejścia zadań oraz formatów produktów.
Źródła:Oficjalna stronaOficjalna dokumentacjaGitHub
Ostatnia weryfikacja: 2026-09-02 · Zgłoś korektę