HumanEvalでDeepSeek-Coder-6.7Bを評価
python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval を実行します
おすすめの対象:モデル開発者
コーディング / 開発者

DeepSeek Harnessは、deepseek-aiが管理するGitHubリポジトリで、lm-evaluation-harnessを基盤にDeepSeekモデル向けの評価スクリプトとタスク設定をすぐに使える形で提供します。
OpenRouter Token ランキング
#8
情報源: OpenRouter

Coding Plan
Coding Pro モデル割引
この製品はコーディング / 開発者カテゴリに属し、主に開発者がローカル環境やサーバーにデプロイして利用することを想定しています。リポジトリをクローンし、依存関係をインストールして指定されたコマンドを実行すると、DeepSeekシリーズのモデルで標準ベンチマークテストを実行できます。DeepSeekモデル向けの適応ファイルとタスクリストがリポジトリにあらかじめ含まれているため、評価コードを自分で記述する必要がない点が大きな特長です。オープンソースまたは独自開発の大規模モデルを一貫した条件で評価したいAI研究者やエンジニアリングチームに適しています。一般的な評価フレームワークと比べて、DeepSeekモデルの重みを読み込む方法に直接対応しており、モデル適応の工程を削減できます。
一言でいうと
DeepSeek Harnessは、deepseek-aiが管理するGitHubリポジトリで、lm-evaluation-harnessを基盤にDeepSeekモデル向けの評価スクリプトとタスク設定をすぐに使える形で提供します。
主な用途
Pythonスクリプトを実行し、MMLUやHumanEvalなどのデータセットで特定のDeepSeekモデルをベンチマークして、スコアを出力します。また、異なるモデルバージョンやチェックポイントの評価結果をまとめて比較する用途にも利用できます。
おすすめの対象
開発者、エンジニアリングチーム、テクニカルリード
使い方
通常はIDE、ターミナル、またはプロジェクト環境のコンテキストを読み取り、Agentが手順を計画してコマンドを実行したりファイルを変更したりします。ユーザーはその結果を確認します。
製品タイプ
拡張機能 / プラグイン
料金
不明
現在の拡充版一括データセットでは、この製品のリアルタイム料金情報を管理していません。公式サイトまたは公式ドキュメントをご確認ください。
APIMaster 連携
対応
DeepSeek Harness → Settings → Models → Add a custom provider
データの信頼性
中
最終確認: 2026-09-02
HumanEvalデータセットを読み込み、モデルによるコード生成を実行して、pass@1、pass@10、pass@100の指標を算出します
vLLMエンジンを通じてモデルを読み込み、テンソル並列処理と継続的バッチ処理に対応したバッチ推論を実行します
YAMLファイルを使って、タスク名、データセットのパス、プロンプトテンプレート、評価指標を定義できます
各サンプルの詳細な結果と全体の指標を含むJSONファイルを生成します
Hugging Face HubからDeepSeek-Coderシリーズのモデル重みを直接読み込みます
MBPPとAPPSのコード生成タスクを標準搭載し、自動ダウンロードと前処理に対応します
python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval を実行します
おすすめの対象:モデル開発者
deepseek-coder-6.7b-baseとdeepseek-coder-v2-lite-baseで同じベンチマークテストをそれぞれ実行し、pass@kを比較します
おすすめの対象:研究者
社内コードリポジトリを指定するYAML設定を作成し、評価を実行して特定のプログラミング言語におけるモデル性能を検証します
おすすめの対象:企業の開発者
vLLMバックエンドを設定し、複数のモデルでMBPPとHumanEvalを同時に実行して比較レポートを生成します
おすすめの対象:AIエンジニア
Base URL
https://apimaster.ai/v1API Key 環境変数
API key(Custom provider 配置项)モデル
gpt-5.6-sol または claude-sonnet-4-6 または deepseek-v4-pro議論の概要
ユーザーは通常、DeepSeek Harnessを「すべてがプラグイン」という中核思想に基づく、高度にモジュール化されたAIコーディングエージェントのオーケストレーションフレームワークとして捉えています。モデル、ツール、セッションログ、エージェントループ、サブエージェントなどのコンポーネントを、設定やカスタムプラグインによって自由に置き換えられます。議論の中心は、プラグインアーキテクチャを使ってパーソナライズされたワークフローを構築する方法、ローカルモデルやClaude Code、Codexなどのサードパーティエージェントと統合する方法、そして実際のコーディングタスクで柔軟性と安定性のバランスを取る方法です。PiやHermesなどの類似ツールとのアーキテクチャ上の違いもよく話題になり、プラグインベースの拡張が異なるシナリオにどのように機能を適応できるかに注目が集まっています。
モデルアダプター、ツール登録、セッションログ、エージェントループなどの中核部分を、プラグインが宣言する依存関係、イベントリスナー、可逆的な登録によって、フレームワークのソースコードを変更せずにシームレスに置き換える方法について議論されています。
DeepSeek Harnessの完全なプラグインベースによるレゴのような設計を、Piのミニマルな基盤やClaude CodeのCLI体験と比較し、コンテキスト管理、コスト管理、カスタマイズの自由度におけるトレードオフや、各ワークフローに適したシナリオを検討しています。
Claude CodeやCodexなどのツールをネイティブサブエージェントとして接続し、設定を通じてサブタスクを振り分け、ステータスや進捗を確認しながらマルチエージェントの協調処理を行う方法に注目しています。
OllamaやQwenなどのローカルモデルをHarnessに接続するためのインストールや設定、WebツールやiOS自動化などのツールプラグインの追加、ローカルWeb UIでの実行と拡張について、ユーザーが経験を共有しています。
コミュニティのプラグインディレクトリの利用、メモリ、サンドボックス、UI機能を拡張する新しいプラグインの作成方法、そしてプラグインAPIの安定性が長期的なカスタムエージェント開発に与える影響について議論されています。
現在は「コーディング / 開発者」カテゴリに分類しており、ページの説明は公式サイトやOpenRouterなどの公開情報をもとにしています。
DeepSeek Harnessの拡充版ページでは、収集済みの主要なタスクとユースケースを優先して掲載しており、現在のニーズに合うかどうかをすばやく判断できます。
現在の資料では、サードパーティキーまたはカスタム互換エンドポイントに対応していることが確認されています。ページの設定手順に従って、そのまま検証を進められます。