Avaliar o DeepSeek-Coder-6.7B no HumanEval
Executar python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval
Indicado para:Desenvolvedores de modelos
Programação / Desenvolvimento

DeepSeek Harness é um repositório do GitHub mantido pela deepseek-ai que oferece scripts de avaliação prontos e configurações de tarefas para modelos DeepSeek baseados no lm-evaluation-harness.
Ranking de uso de tokens no OpenRouter
#8
Fontes: OpenRouter

Coding Plan
Descontos em modelos Coding Pro
Este produto pertence à categoria Programação / Desenvolvimento e destina-se principalmente a desenvolvedores que o implantam e utilizam localmente ou em servidores. Ao clonar o repositório, instalar as dependências e executar os comandos especificados, os usuários podem realizar testes de benchmark padrão em modelos da série DeepSeek. Seu principal diferencial é que o repositório já inclui arquivos de adaptação e listas de tarefas para modelos DeepSeek, dispensando a necessidade de escrever o próprio código de avaliação. É adequado para pesquisadores de IA e equipes de engenharia que precisam avaliar de forma consistente modelos de linguagem de grande porte, sejam eles de código aberto ou proprietários. Em comparação com frameworks de avaliação gerais, ele se integra diretamente aos métodos de carregamento de pesos dos modelos DeepSeek, reduzindo a etapa de adaptação do modelo.
Resumo em uma linha
DeepSeek Harness é um repositório do GitHub mantido pela deepseek-ai que oferece scripts de avaliação prontos e configurações de tarefas para modelos DeepSeek baseados no lm-evaluation-harness.
Para que as pessoas usam
Os usuários o utilizam para executar scripts Python, avaliar modelos DeepSeek específicos em conjuntos de dados como MMLU e HumanEval e gerar pontuações. Também o utilizam para comparar em lote os resultados de avaliação entre diferentes versões de modelos ou checkpoints.
Indicado para
Desenvolvedores, equipes de engenharia e líderes técnicos
Como funciona
Normalmente, o processo começa com a leitura do contexto em um IDE, terminal ou ambiente de projeto. Em seguida, o Agente planeja as etapas, executa comandos ou modifica arquivos, e o usuário verifica os resultados.
Tipo de produto
Extensão / Plugin
Preços
Desconhecido
O conjunto de dados em massa aprimorado atual não mantém informações de preços em tempo real para este produto. Consulte o site ou a documentação oficial.
Integração com APIMaster
Compatível
DeepSeek Harness → Configurações → Modelos → Adicionar um provedor personalizado
Confiabilidade dos dados
Média
Última verificação: 2026-09-02
Carregar o conjunto de dados HumanEval, executar a geração de código pelo modelo e calcular as métricas pass@1, pass@10 e pass@100
Carregar modelos por meio do mecanismo vLLM para realizar inferência em lote, com suporte a paralelismo de tensores e batching contínuo
Usar arquivos YAML para definir nomes de tarefas, caminhos dos conjuntos de dados, modelos de prompt e métricas de avaliação
Gerar arquivos JSON contendo resultados detalhados de cada amostra e métricas gerais
Carregar diretamente do Hugging Face Hub os pesos dos modelos da série DeepSeek-Coder
Tarefas integradas de geração de código para MBPP e APPS, com suporte a download e pré-processamento automáticos
Executar python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval
Indicado para:Desenvolvedores de modelos
Executar os mesmos testes de benchmark em deepseek-coder-6.7b-base e deepseek-coder-v2-lite-base, respectivamente, e comparar o pass@k
Indicado para:Pesquisadores
Escrever uma configuração YAML apontando para um repositório interno de código e executar a avaliação para verificar o desempenho do modelo em uma linguagem de programação específica
Indicado para:Desenvolvedores corporativos
Configurar o backend vLLM para executar MBPP e HumanEval em vários modelos simultaneamente e gerar relatórios comparativos
Indicado para:Engenheiros de IA
Base URL
https://apimaster.ai/v1Variável de ambiente da chave API
API key(Custom provider 配置项)Modelo
gpt-5.6-sol ou claude-sonnet-4-6 ou deepseek-v4-proResumo das discussões
Os usuários geralmente entendem o DeepSeek Harness como um framework modular de orquestração de agentes de programação com IA, baseado na ideia central de que "tudo é um plugin". Isso permite substituir livremente, por meio de configurações ou plugins personalizados, componentes como modelos, ferramentas, registros de sessão, loops de agente e subagentes. As discussões se concentram em como usar sua arquitetura de plugins para criar fluxos de trabalho personalizados, integrar modelos locais ou agentes de terceiros, como Claude Code e Codex, e equilibrar flexibilidade e estabilidade em tarefas reais de programação. Os usuários também costumam discutir suas diferenças arquiteturais em relação a ferramentas semelhantes, como Pi e Hermes, com atenção à forma como as extensões baseadas em plugins podem adaptar a funcionalidade a diferentes cenários.
Os usuários discutem como partes essenciais, como adaptadores de modelos, registro de ferramentas, registros de sessão e loops de agente, podem ser substituídas de forma integrada por meio de dependências declaradas por plugins, listeners de eventos e registros reversíveis, sem modificar o código-fonte do framework.
Os usuários comparam o design totalmente baseado em plugins e no estilo Lego do DeepSeek Harness com a base minimalista do Pi ou a experiência de linha de comando do Claude Code, explorando as vantagens e desvantagens em gerenciamento de contexto, controle de custos e liberdade de personalização, além dos cenários mais adequados a cada fluxo de trabalho.
Os usuários se concentram em como conectar ferramentas como Claude Code ou Codex como subagentes nativos, roteando subtarefas e verificando status e progresso por meio de configurações para orquestrar a colaboração entre vários agentes.
Os usuários compartilham experiências de instalação e configuração para conectar modelos locais, como Ollama e Qwen, ao Harness, adicionar plugins de ferramentas, como ferramentas web e automação do iOS, e executar e estender o produto em uma interface Web local.
Os usuários discutem como usar o diretório de plugins da comunidade, escrever novos plugins para ampliar recursos de memória, sandbox ou interface, e como a estabilidade da API de plugins afeta o desenvolvimento de agentes personalizados no longo prazo.
Atualmente, nós o classificamos na categoria "Programação / Desenvolvimento", e a descrição da página baseia-se em fontes públicas, como o site oficial e o OpenRouter.
A página aprimorada do DeepSeek Harness prioriza as principais tarefas e casos de uso já coletados, ajudando você a avaliar rapidamente se ele atende às suas necessidades atuais.
Os materiais atuais confirmaram que o produto oferece suporte a chaves de terceiros ou endpoints compatíveis personalizados. Portanto, você pode continuar a verificação diretamente de acordo com as instruções de configuração da página.
Também pertence à categoria Programação / Desenvolvimento e é adequado para comparar lado a lado diferentes pontos de entrada de tarefas e formatos de produto.
Também pertence à categoria Programação / Desenvolvimento e é adequado para comparar lado a lado diferentes pontos de entrada de tarefas e formatos de produto.
Também pertence à categoria Programação / Desenvolvimento e é adequado para comparar lado a lado diferentes pontos de entrada de tarefas e formatos de produto.
Fontes:Site oficialDocumentação oficialGitHub
Última verificação: 2026-09-02 · Reportar uma correção