Évaluer DeepSeek-Coder-6.7B sur HumanEval
Exécuter python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval
Pour qui:Développeurs de modèles
Programmation / Développement

DeepSeek Harness est un dépôt GitHub maintenu par deepseek-ai qui fournit des scripts d’évaluation prêts à l’emploi et des configurations de tâches pour les modèles DeepSeek, basés sur lm-evaluation-harness.
Classement d’utilisation des tokens OpenRouter
#8
Sources: OpenRouter

Coding Plan
Réductions sur les modèles Coding Pro
Ce produit appartient à la catégorie Programmation / Développement et s’adresse principalement aux développeurs qui souhaitent le déployer et l’utiliser localement ou sur des serveurs. En clonant le dépôt, en installant les dépendances et en exécutant les commandes indiquées, vous pouvez lancer des tests de référence standard sur les modèles de la série DeepSeek. Son principal atout est d’intégrer déjà les fichiers d’adaptation et les listes de tâches pour les modèles DeepSeek : vous n’avez donc pas besoin d’écrire vous-même le code d’évaluation. Il convient aux chercheurs en IA et aux équipes d’ingénierie qui ont besoin d’évaluer de manière cohérente des modèles de langage open source ou propriétaires de grande taille. Contrairement aux frameworks d’évaluation généralistes, il s’appuie directement sur les méthodes de chargement des poids des modèles DeepSeek, ce qui réduit l’étape d’adaptation du modèle.
Résumé en une phrase
DeepSeek Harness est un dépôt GitHub maintenu par deepseek-ai qui fournit des scripts d’évaluation prêts à l’emploi et des configurations de tâches pour les modèles DeepSeek, basés sur lm-evaluation-harness.
À quoi sert-il
Vous pouvez l’utiliser pour exécuter des scripts Python, évaluer des modèles DeepSeek spécifiques sur des jeux de données tels que MMLU et HumanEval, puis produire des scores. Il permet également de comparer par lots les résultats d’évaluation de différentes versions ou de différents checkpoints de modèles.
Pour qui
Développeurs, équipes d’ingénierie et responsables techniques
Fonctionnement
Le processus commence généralement par la lecture du contexte dans un IDE, un terminal ou un environnement de projet. L’Agent planifie ensuite les étapes, exécute les commandes ou modifie les fichiers, puis vous vérifiez les résultats.
Type de produit
Extension / Plugin
Tarifs
Inconnu
L’ensemble de données enrichi actuel ne fournit pas d’informations tarifaires en temps réel pour ce produit. Consultez le site officiel ou la documentation officielle.
Intégration APIMaster
Pris en charge
DeepSeek Harness → Settings → Models → Add a custom provider
Fiabilité des données
Moyenne
Dernière vérification : 2026-09-02
Charger le jeu de données HumanEval, exécuter la génération de code par le modèle et calculer les métriques pass@1, pass@10 et pass@100
Charger les modèles via le moteur vLLM pour effectuer des inférences par lots, avec prise en charge du parallélisme tensoriel et du traitement continu par lots
Utiliser des fichiers YAML pour définir les noms des tâches, les chemins des jeux de données, les modèles d’invite et les métriques d’évaluation
Générer des fichiers JSON contenant les résultats détaillés de chaque échantillon ainsi que les métriques globales
Charger directement depuis Hugging Face Hub les poids des modèles de la série DeepSeek-Coder
Profiter de tâches intégrées de génération de code pour MBPP et APPS, avec prise en charge du téléchargement et du prétraitement automatiques
Exécuter python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval
Pour qui:Développeurs de modèles
Exécuter les mêmes tests de référence sur deepseek-coder-6.7b-base et deepseek-coder-v2-lite-base, puis comparer les valeurs pass@k
Pour qui:Chercheurs
Rédiger une configuration YAML pointant vers un dépôt de code interne, puis lancer l’évaluation afin de vérifier les performances du modèle dans un langage de programmation spécifique
Pour qui:Développeurs en entreprise
Configurer le backend vLLM pour exécuter simultanément MBPP et HumanEval sur plusieurs modèles et générer des rapports comparatifs
Pour qui:Ingénieurs IA
Base URL
https://apimaster.ai/v1Variable d’environnement de la clé API
API key(Custom provider 配置项)Modèle
gpt-5.6-sol ou claude-sonnet-4-6 ou deepseek-v4-proRésumé des discussions
Les utilisateurs considèrent généralement DeepSeek Harness comme un framework d’orchestration d’agents de programmation IA hautement modulaire, fondé sur l’idée centrale que « tout est un plugin ». Les composants tels que les modèles, les outils, les journaux de session, les boucles d’agent et les sous-agents peuvent ainsi être remplacés librement par configuration ou au moyen de plugins personnalisés. Les échanges portent surtout sur l’utilisation de son architecture de plugins pour créer des workflows personnalisés, l’intégration de modèles locaux ou d’agents tiers tels que Claude Code et Codex, ainsi que l’équilibre entre flexibilité et stabilité dans les tâches de programmation réelles. Les utilisateurs discutent également souvent de ses différences architecturales avec des outils similaires comme Pi et Hermes, en s’intéressant à la manière dont les extensions basées sur des plugins peuvent adapter les fonctionnalités à différents scénarios.
Les utilisateurs expliquent comment les éléments centraux, tels que les adaptateurs de modèles, l’enregistrement des outils, les journaux de session et les boucles d’agent, peuvent être remplacés de manière transparente grâce aux dépendances déclarées par les plugins, aux écouteurs d’événements et à un enregistrement réversible, sans modifier le code source du framework.
Les utilisateurs comparent la conception entièrement basée sur des plugins, semblable à des briques Lego, de DeepSeek Harness avec la base minimaliste de Pi ou l’expérience en ligne de commande de Claude Code. Ils étudient les compromis en matière de gestion du contexte, de contrôle des coûts et de liberté de personnalisation, ainsi que les scénarios adaptés à chaque workflow.
Les utilisateurs s’intéressent à la façon de connecter des outils tels que Claude Code ou Codex en tant que sous-agents natifs, de distribuer les sous-tâches et de suivre l’état et la progression au moyen de la configuration afin d’orchestrer une collaboration multi-agent.
Les utilisateurs partagent leur expérience d’installation et de configuration pour connecter à Harness des modèles locaux tels qu’Ollama et Qwen, ajouter des plugins d’outils comme des outils web et l’automatisation iOS, puis l’exécuter et l’étendre dans une interface Web locale.
Les utilisateurs échangent sur l’utilisation du répertoire de plugins de la communauté, la création de nouveaux plugins pour étendre les fonctionnalités de mémoire, de sandbox ou d’interface utilisateur, ainsi que sur l’influence de la stabilité de l’API des plugins sur le développement d’agents personnalisés à long terme.
Nous le classons actuellement dans la catégorie « Programmation / Développement », et la description de cette page repose sur des sources publiques telles que le site officiel et OpenRouter.
La page enrichie de DeepSeek Harness met en avant les tâches principales et les cas d’utilisation déjà recensés, afin de vous aider à déterminer rapidement s’il répond à vos besoins actuels.
Les informations actuellement disponibles confirment que le produit prend en charge les clés tierces ou les endpoints compatibles personnalisés. Vous pouvez donc poursuivre la vérification directement en suivant les instructions de configuration de la page.
Également classé dans la catégorie Programmation / Développement, il convient pour comparer côte à côte différents points d’entrée de tâches et formats de produits.
Également classé dans la catégorie Programmation / Développement, il convient pour comparer côte à côte différents points d’entrée de tâches et formats de produits.
Également classé dans la catégorie Programmation / Développement, il convient pour comparer côte à côte différents points d’entrée de tâches et formats de produits.
Sources:Site officielDocumentation officielleGitHub
Dernière vérification : 2026-09-02 · Signaler une correction