APIMaster.ai

编程 / 开发者

DeepSeek Harness logo

DeepSeek Harness

DeepSeek Harness 是 deepseek-ai 维护的 GitHub 仓库,基于 lm-evaluation-harness 为 DeepSeek 模型提供现成的评估脚本和任务配置。

产品类型: 扩展 / 插件价格信息: 未知APIMaster 接入状态: 已支持

Token消耗排名

#8

来源: OpenRouter

DeepSeek Harness 官网首页预览

产品概览

该产品属于 Coding / Developer 类别,主要供开发者在本地或服务器上部署使用。用户通过克隆仓库、安装依赖并执行指定命令,对 DeepSeek 系列模型运行标准基准测试。核心特色在于仓库内已包含针对 DeepSeek 模型的适配文件和任务列表,无需用户自行编写评估代码。适合需要对开源或自有大模型进行一致性评估的 AI 研究人员和工程团队。与通用评估框架相比,它直接绑定 DeepSeek 模型权重加载方式,减少了模型适配环节。

一句话描述

DeepSeek Harness 是 deepseek-ai 维护的 GitHub 仓库,基于 lm-evaluation-harness 为 DeepSeek 模型提供现成的评估脚本和任务配置。

用户通常拿它做什么

用户用它来执行 python 脚本,对特定 DeepSeek 模型在 MMLU、HumanEval 等数据集上跑测试并输出分数。用户还会用它批量对比不同模型版本或 checkpoint 的评估结果。

适合人群

开发者、工程团队和技术负责人

使用方式

通常先在 IDE、终端或项目环境中读取上下文,再由 Agent 规划步骤、执行命令或修改文件,并由用户检查结果。

关键信息

产品类型

扩展 / 插件

价格信息

未知

当前增强版批量资料未为该产品维护实时定价,请以官网或官方文档为准。

APIMaster 接入状态

已支持

DeepSeek Harness → Settings → Models → Add a custom provider

资料可信度

最后核验:2026-08-30

主要功能与卖点

运行HumanEval基准测试

加载HumanEval数据集,执行模型代码生成并计算pass@1、pass@10、pass@100指标

支持vLLM后端推理

通过vLLM引擎加载模型进行批量推理,支持张量并行和连续批处理

自定义YAML任务配置

使用YAML文件定义任务名称、数据集路径、提示模板和评估指标

输出JSON评估报告

生成包含每个样本详细结果和总体指标的JSON文件

集成Hugging Face模型加载

直接从Hugging Face Hub加载DeepSeek-Coder系列模型权重

支持MBPP和APPS数据集

内置MBPP和APPS代码生成任务,支持自动下载和预处理

DeepSeek Harness 适合哪些任务?

在HumanEval上评估DeepSeek-Coder-6.7B

运行python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval

适合人群模型开发者

对比v1和v2版本模型性能

分别对deepseek-coder-6.7b-base和deepseek-coder-v2-lite-base执行相同基准测试并对比pass@k

适合人群研究人员

添加自定义代码数据集

编写YAML配置指向内部代码仓库,运行评估验证模型在特定编程语言上的表现

适合人群企业开发者

使用vLLM加速批量评估

配置vLLM后端对多个模型同时运行MBPP和HumanEval,生成对比报告

适合人群AI工程师

DeepSeek Harness 配置第三方 Key(APIMaster 接入方式)

已支持

配置步骤

  1. 1打开 Settings → Models,点击 Add a custom provider。
  2. 2填写 Provider ID、Display name、Base URL、API protocol 和 API key。
  3. 3通过手填或 Fetch available models 添加可用模型。
  4. 4保存后回到会话模型选择器,选择该 custom provider 下的模型做最小验证。

配置值

Base URL

https://apimaster.ai/v1

API Key 环境变量

API key(Custom provider 配置项)

模型

gpt-5.6-sol 或 claude-sonnet-4-6 或 deepseek-v4-pro

社区讨论

讨论概览

用户通常将 DeepSeek Harness 理解为一个高度模块化的 AI 编码代理编排框架,核心理念是“一切皆插件”,允许通过配置或自定义插件自由替换模型、工具、会话日志、代理循环和子代理等组件。讨论集中在如何利用其插件架构实现个性化工作流、与本地模型或第三方代理(如 Claude Code、Codex)集成,以及在实际编码任务中平衡灵活性与稳定性。用户还经常探讨其与同类工具(如 Pi、Hermes)的架构差异,关注如何通过插件扩展功能以适应不同场景。

讨论最多的主题

  1. 1

    插件架构如何实现组件替换?

    用户讨论模型适配器、工具注册、会话日志和代理循环等核心部分如何通过插件声明依赖、事件监听和可逆注册来实现无缝替换,而无需修改框架源码。

  2. 2

    与 Pi、Claude Code 等工具的对比选择?

    用户比较 DeepSeek Harness 的全插件乐高式设计与 Pi 的极简底盘或 Claude Code 的 CLI 体验,探讨在上下文管理、成本控制和自定义自由度上的优劣,以及适合不同工作流的场景。

  3. 3

    子代理支持与任务路由?

    用户关注如何将 Claude Code 或 Codex 等作为原生子代理接入,通过配置路由子任务、检查状态和进度,实现多代理协作的编排。

  4. 4

    本地模型与工具集成实践?

    用户分享通过 Ollama、Qwen 等本地模型连接 Harness 的安装配置、工具插件添加(如网络工具、iOS 自动化),以及如何在本地 Web UI 中运行和扩展。

  5. 5

    插件生态与自定义开发?

    用户讨论社区插件目录的使用、如何编写新插件扩展内存、沙箱或 UI 功能,以及插件 API 稳定性对长期构建自定义代理的影响。

常见问题

DeepSeek Harness 是什么类型的产品?

当前我们将它归入“编程 / 开发者”分类,页面说明以官网和 OpenRouter 等公开资料为准。

DeepSeek Harness 适合做什么?

DeepSeek Harness 的增强版页面会优先展示已采集到的核心任务和用例,帮助你快速判断是否匹配当前需求。

DeepSeek Harness 现在能直接接入 APIMaster 吗?

当前资料已经确认产品支持第三方 Key 或自定义兼容端点,可以直接按页面配置说明继续验证。

相似 Agent

来源官方网站官方文档GitHub

最后核验:2026-08-30 · 报告修正