Evaluar DeepSeek-Coder-6.7B con HumanEval
Ejecutar python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval
Recomendado para:Desarrolladores de modelos
Programación / Desarrollo

DeepSeek Harness es un repositorio de GitHub mantenido por deepseek-ai que ofrece scripts de evaluación listos para usar y configuraciones de tareas para modelos DeepSeek basados en lm-evaluation-harness.
Clasificación de uso de tokens de OpenRouter
#8
Fuentes: OpenRouter

Coding Plan
Descuentos en modelos Coding Pro
Este producto pertenece a la categoría de Programación / Desarrollo y está destinado principalmente a desarrolladores que lo implementan y utilizan localmente o en servidores. Al clonar el repositorio, instalar las dependencias y ejecutar los comandos especificados, los usuarios pueden realizar pruebas de referencia estándar en modelos de la serie DeepSeek. Su principal ventaja es que el repositorio ya incluye archivos de adaptación y listas de tareas para modelos DeepSeek, por lo que los usuarios no necesitan escribir el código de evaluación por su cuenta. Es adecuado para investigadores de IA y equipos de ingeniería que necesitan una evaluación coherente de modelos grandes de código abierto o propietarios. En comparación con los frameworks de evaluación generales, se integra directamente con los métodos de carga de pesos de los modelos DeepSeek, lo que reduce el trabajo de adaptación del modelo.
Resumen en una línea
DeepSeek Harness es un repositorio de GitHub mantenido por deepseek-ai que ofrece scripts de evaluación listos para usar y configuraciones de tareas para modelos DeepSeek basados en lm-evaluation-harness.
Para qué se utiliza
Los usuarios lo emplean para ejecutar scripts de Python, comparar modelos DeepSeek específicos con conjuntos de datos como MMLU y HumanEval, y generar puntuaciones. También lo utilizan para comparar en lotes los resultados de evaluación entre distintas versiones de modelos o checkpoints.
Recomendado para
Desarrolladores, equipos de ingeniería y responsables técnicos
Cómo funciona
Normalmente comienza leyendo el contexto en un IDE, terminal o entorno de proyecto. Después, el Agent planifica los pasos, ejecuta comandos o modifica archivos, y el usuario revisa los resultados.
Tipo de producto
Extensión / Plugin
Precios
Desconocido
El conjunto de datos ampliado actual no mantiene información de precios en tiempo real para este producto. Consulta el sitio web oficial o la documentación oficial.
Integración con APIMaster
Compatible
DeepSeek Harness → Configuración → Modelos → Añadir un proveedor personalizado
Fiabilidad de los datos
Media
Última verificación: 2026-09-02
Cargar el conjunto de datos HumanEval, ejecutar la generación de código del modelo y calcular las métricas pass@1, pass@10 y pass@100
Cargar modelos mediante el motor vLLM para realizar inferencias por lotes, con compatibilidad con paralelismo tensorial y batching continuo
Usar archivos YAML para definir nombres de tareas, rutas de conjuntos de datos, plantillas de prompts y métricas de evaluación
Generar archivos JSON con resultados detallados de cada muestra y métricas generales
Cargar directamente desde Hugging Face Hub los pesos de los modelos de la serie DeepSeek-Coder
Tareas integradas de generación de código para MBPP y APPS, con compatibilidad para la descarga y el preprocesamiento automáticos
Ejecutar python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval
Recomendado para:Desarrolladores de modelos
Ejecutar las mismas pruebas de referencia en deepseek-coder-6.7b-base y deepseek-coder-v2-lite-base, respectivamente, y comparar pass@k
Recomendado para:Investigadores
Escribir una configuración YAML que apunte a un repositorio interno de código y ejecutar la evaluación para verificar el rendimiento del modelo en un lenguaje de programación específico
Recomendado para:Desarrolladores empresariales
Configurar el backend vLLM para ejecutar MBPP y HumanEval en varios modelos al mismo tiempo y generar informes comparativos
Recomendado para:Ingenieros de IA
Base URL
https://apimaster.ai/v1Variable de entorno de la clave API
API key(Custom provider 配置项)Modelo
gpt-5.6-sol o claude-sonnet-4-6 o deepseek-v4-proResumen del debate
Los usuarios suelen entender DeepSeek Harness como un framework altamente modular de orquestación de agentes de programación con IA, basado en la idea central de que "todo es un plugin". Esto permite sustituir libremente mediante configuración o plugins personalizados componentes como modelos, herramientas, registros de sesiones, bucles de agentes y subagentes. Las conversaciones se centran en cómo utilizar su arquitectura de plugins para crear flujos de trabajo personalizados, integrarlo con modelos locales o agentes de terceros como Claude Code y Codex, y equilibrar flexibilidad y estabilidad en tareas reales de programación. Los usuarios también suelen analizar sus diferencias arquitectónicas con herramientas similares como Pi y Hermes, prestando atención a cómo las extensiones basadas en plugins pueden adaptar la funcionalidad a distintos escenarios.
Los usuarios analizan cómo partes centrales como los adaptadores de modelos, el registro de herramientas, los registros de sesiones y los bucles de agentes pueden sustituirse sin problemas mediante dependencias declaradas por plugins, listeners de eventos y registros reversibles, sin modificar el código fuente del framework.
Los usuarios comparan el diseño completamente basado en plugins y con estilo Lego de DeepSeek Harness con la base minimalista de Pi o la experiencia de CLI de Claude Code, y exploran las ventajas y desventajas en gestión del contexto, control de costes y libertad de personalización, así como los escenarios adecuados para cada flujo de trabajo.
Los usuarios se centran en cómo conectar herramientas como Claude Code o Codex como subagentes nativos, dirigir subtareas y comprobar el estado y el progreso mediante configuración para orquestar la colaboración entre varios agentes.
Los usuarios comparten su experiencia de instalación y configuración para conectar modelos locales como Ollama y Qwen con Harness, añadir plugins de herramientas como herramientas web y automatización de iOS, y ejecutarlo y ampliarlo en una interfaz web local.
Los usuarios debaten sobre el uso del directorio de plugins de la comunidad, la creación de nuevos plugins para ampliar las capacidades de memoria, sandbox o interfaz de usuario, y cómo la estabilidad de la API de plugins afecta al desarrollo de agentes personalizados a largo plazo.
Actualmente lo clasificamos en la categoría de "Programación / Desarrollo", y la descripción de la página se basa en fuentes públicas como el sitio web oficial y OpenRouter.
La página ampliada de DeepSeek Harness prioriza las tareas principales y los casos de uso que ya se han recopilado, para ayudarte a determinar rápidamente si se ajusta a tus necesidades actuales.
Los materiales actuales han confirmado que el producto admite claves de terceros o endpoints compatibles personalizados, por lo que puedes continuar la verificación directamente siguiendo las instrucciones de configuración de la página.
También pertenece a la categoría de Programación / Desarrollo y es adecuado para comparar lado a lado distintos puntos de entrada de tareas y formatos de producto.
También pertenece a la categoría de Programación / Desarrollo y es adecuado para comparar lado a lado distintos puntos de entrada de tareas y formatos de producto.
También pertenece a la categoría de Programación / Desarrollo y es adecuado para comparar lado a lado distintos puntos de entrada de tareas y formatos de producto.
Fuentes:Sitio oficialDocumentación oficialGitHub
Última verificación: 2026-09-02 · Informar de una corrección