DeepSeek-Coder-6.7B mit HumanEval evaluieren
python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval ausführen
Geeignet für:Modellentwickler
Coding / Entwicklung

DeepSeek Harness ist ein von deepseek-ai gepflegtes GitHub-Repository mit fertigen Evaluierungsskripten und Aufgabenkonfigurationen für DeepSeek-Modelle auf Basis von lm-evaluation-harness.
OpenRouter-Token-Nutzungsrang
#8
Quellen: OpenRouter

Coding Plan
Coding-Pro-Modellrabatte
Dieses Produkt gehört zur Kategorie Coding / Developer und richtet sich hauptsächlich an Entwickler, die es lokal oder auf Servern bereitstellen und nutzen möchten. Durch das Klonen des Repositorys, die Installation der Abhängigkeiten und die Ausführung der angegebenen Befehle können Nutzer standardisierte Benchmark-Tests für Modelle der DeepSeek-Serie durchführen. Die zentrale Stärke besteht darin, dass das Repository bereits Anpassungsdateien und Aufgabenlisten für DeepSeek-Modelle enthält. Nutzer müssen daher keinen Evaluierungscode selbst schreiben. Das Produkt eignet sich für KI-Forscher und Engineering-Teams, die eine konsistente Bewertung von Open-Source- oder proprietären großen Sprachmodellen benötigen. Im Vergleich zu allgemeinen Evaluierungs-Frameworks ist es direkt an die Methoden zum Laden der Gewichte von DeepSeek-Modellen angebunden, wodurch der Anpassungsschritt für das Modell entfällt.
Kurzfassung
DeepSeek Harness ist ein von deepseek-ai gepflegtes GitHub-Repository mit fertigen Evaluierungsskripten und Aufgabenkonfigurationen für DeepSeek-Modelle auf Basis von lm-evaluation-harness.
Wofür wird es genutzt
Nutzer verwenden es, um Python-Skripte auszuführen, bestimmte DeepSeek-Modelle anhand von Datensätzen wie MMLU und HumanEval zu bewerten und Ergebnisse auszugeben. Außerdem können sie damit Evaluierungsergebnisse verschiedener Modellversionen oder Checkpoints stapelweise vergleichen.
Geeignet für
Entwickler, Engineering-Teams und technische Leiter
So funktioniert es
In der Regel beginnt der Prozess mit dem Einlesen des Kontexts in einer IDE, einem Terminal oder einer Projektumgebung. Anschließend plant der Agent die erforderlichen Schritte, führt Befehle aus oder ändert Dateien, während der Nutzer die Ergebnisse überprüft.
Produkttyp
Erweiterung / Plugin
Preise
Unbekannt
Derzeit enthält der erweiterte Massendatensatz keine Echtzeit-Preisinformationen für dieses Produkt. Bitte informieren Sie sich auf der offiziellen Website oder in der offiziellen Dokumentation.
APIMaster-Integration
Unterstützt
DeepSeek Harness → Settings → Models → Add a custom provider
Datenzuverlässigkeit
Mittel
Zuletzt geprüft: 2026-09-02
Den HumanEval-Datensatz laden, die Codegenerierung durch das Modell ausführen und die Metriken pass@1, pass@10 und pass@100 berechnen
Modelle über die vLLM-Engine für die Stapelverarbeitung laden, einschließlich Unterstützung für Tensor-Parallelismus und kontinuierliches Batching
YAML-Dateien verwenden, um Aufgabennamen, Datensatzpfade, Prompt-Vorlagen und Evaluierungsmetriken zu definieren
JSON-Dateien mit detaillierten Ergebnissen für jedes Beispiel und den Gesamtmetriken erzeugen
Gewichte von Modellen der DeepSeek-Coder-Serie direkt aus dem Hugging Face Hub laden
Integrierte Aufgaben zur Codegenerierung für MBPP und APPS mit Unterstützung für automatischen Download und Vorverarbeitung
python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval ausführen
Geeignet für:Modellentwickler
Dieselben Benchmark-Tests jeweils auf deepseek-coder-6.7b-base und deepseek-coder-v2-lite-base ausführen und pass@k vergleichen
Geeignet für:Forscher
Eine YAML-Konfiguration erstellen, die auf ein internes Code-Repository verweist, und anschließend eine Evaluierung ausführen, um die Modellleistung für eine bestimmte Programmiersprache zu überprüfen
Geeignet für:Entwickler in Unternehmen
Das vLLM-Backend konfigurieren, um MBPP und HumanEval gleichzeitig auf mehreren Modellen auszuführen und Vergleichsberichte zu erstellen
Geeignet für:KI-Ingenieure
Base URL
https://apimaster.ai/v1API-Key-Umgebungsvariable
API key(Custom provider 配置项)Modell
gpt-5.6-sol oder claude-sonnet-4-6 oder deepseek-v4-proZusammenfassung der Diskussion
Nutzer verstehen DeepSeek Harness meist als ein hochgradig modulares Orchestrierungs-Framework für KI-Coding-Agents, das auf der Grundidee "everything is a plugin" basiert. Dadurch lassen sich Komponenten wie Modelle, Tools, Sitzungsprotokolle, Agent-Schleifen und Sub-Agents über die Konfiguration oder benutzerdefinierte Plugins frei austauschen. Im Mittelpunkt der Diskussion steht, wie sich mit der Plugin-Architektur personalisierte Workflows erstellen und lokale Modelle oder Drittanbieter-Agents wie Claude Code und Codex integrieren lassen, während gleichzeitig ein ausgewogenes Verhältnis zwischen Flexibilität und Stabilität bei echten Coding-Aufgaben erhalten bleibt. Nutzer diskutieren außerdem häufig die architektonischen Unterschiede zu ähnlichen Tools wie Pi und Hermes. Dabei geht es insbesondere darum, wie pluginbasierte Erweiterungen Funktionen an unterschiedliche Szenarien anpassen können.
Nutzer diskutieren, wie zentrale Bestandteile wie Modelladapter, Tool-Registrierung, Sitzungsprotokolle und Agent-Schleifen über von Plugins deklarierte Abhängigkeiten, Event-Listener und rückgängig machbare Registrierungen nahtlos ersetzt werden können, ohne den Quellcode des Frameworks zu ändern.
Nutzer vergleichen das vollständig pluginbasierte Lego-Prinzip von DeepSeek Harness mit Pis minimalistischer Grundlage und der CLI-Erfahrung von Claude Code. Dabei untersuchen sie Kompromisse bei Kontextverwaltung, Kostenkontrolle und Anpassungsfreiheit sowie die Eignung der verschiedenen Tools für unterschiedliche Workflows.
Nutzer konzentrieren sich darauf, wie sich Tools wie Claude Code oder Codex als native Sub-Agents anbinden lassen, um Teilaufgaben weiterzuleiten sowie Status und Fortschritt über die Konfiguration zu überprüfen und so die Zusammenarbeit mehrerer Agents zu orchestrieren.
Nutzer teilen ihre Erfahrungen bei der Installation und Konfiguration lokaler Modelle wie Ollama und Qwen in Harness, beim Hinzufügen von Tool-Plugins wie Web-Tools und iOS-Automatisierung sowie bei der lokalen Ausführung und Erweiterung über eine Web-UI.
Nutzer diskutieren die Verwendung des Community-Plugin-Verzeichnisses, die Entwicklung neuer Plugins zur Erweiterung von Speicher-, Sandbox- oder UI-Funktionen und den Einfluss der Stabilität der Plugin-API auf die langfristige Entwicklung benutzerdefinierter Agents.
Wir ordnen es derzeit der Kategorie "Coding / Developer" zu. Die Beschreibung dieser Seite basiert auf öffentlichen Quellen wie der offiziellen Website und OpenRouter.
Die erweiterte Seite zu DeepSeek Harness stellt die bereits erfassten zentralen Aufgaben und Anwendungsfälle in den Vordergrund. So können Sie schnell einschätzen, ob das Produkt zu Ihren aktuellen Anforderungen passt.
Die aktuellen Unterlagen bestätigen, dass das Produkt Drittanbieter-Keys oder benutzerdefinierte kompatible Endpunkte unterstützt. Sie können dies anhand der Konfigurationsanweisungen auf der Seite direkt weiter überprüfen.
Ebenfalls der Kategorie Coding / Developer zugeordnet und für den direkten Vergleich verschiedener Aufgabeneinstiege und Produktformate geeignet.
Ebenfalls der Kategorie Coding / Developer zugeordnet und für den direkten Vergleich verschiedener Aufgabeneinstiege und Produktformate geeignet.
Ebenfalls der Kategorie Coding / Developer zugeordnet und für den direkten Vergleich verschiedener Aufgabeneinstiege und Produktformate geeignet.
Quellen:Offizielle WebsiteOffizielle DokumentationGitHub
Zuletzt geprüft: 2026-09-02 · Korrektur melden