HumanEval에서 DeepSeek-Coder-6.7B 평가
Run python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval
추천 대상:모델 개발자
Coding Plan
Coding Pro 모델 할인
이 제품은 코딩 / 개발자 카테고리에 속하며, 주로 개발자가 로컬 환경이나 서버에 배포하여 사용하도록 설계되었습니다. 저장소를 복제하고 종속성을 설치한 다음 지정된 명령을 실행하면 DeepSeek 시리즈 모델에서 표준 벤치마크 테스트를 수행할 수 있습니다. 저장소에 DeepSeek 모델에 맞게 조정된 파일과 작업 목록이 이미 포함되어 있다는 점이 핵심적인 장점이므로, 사용자가 직접 평가 코드를 작성할 필요가 없습니다. 오픈 소스 또는 독점 대규모 모델을 일관된 방식으로 평가해야 하는 AI 연구자와 엔지니어링 팀에 적합합니다. 일반적인 평가 프레임워크와 비교하면 DeepSeek 모델 가중치 로딩 방식과 직접 연동되어 모델 조정 단계를 줄여 줍니다.
한 줄 요약
DeepSeek Harness는 deepseek-ai가 유지 관리하는 GitHub 저장소로, lm-evaluation-harness를 기반으로 DeepSeek 모델을 평가할 수 있는 사전 제작 평가 스크립트와 작업 구성을 제공합니다.
주요 용도
사용자는 이를 통해 python 스크립트를 실행하고, MMLU 및 HumanEval과 같은 데이터셋에서 특정 DeepSeek 모델을 벤치마크한 후 점수를 출력할 수 있습니다. 또한 여러 모델 버전이나 체크포인트의 평가 결과를 일괄적으로 비교할 수 있습니다.
추천 대상
개발자, 엔지니어링 팀 및 기술 리드
사용 방법
일반적으로 IDE, 터미널 또는 프로젝트 환경의 컨텍스트를 읽는 것부터 시작한 다음 Agent가 단계를 계획하고 명령을 실행하거나 파일을 수정하며, 사용자가 결과를 확인합니다.
제품 유형
확장 프로그램 / 플러그인
가격
알 수 없음
현재 확장 데이터셋에는 이 제품의 실시간 가격 정보가 유지되지 않습니다. 공식 웹사이트 또는 공식 문서를 참조하시기 바랍니다.
APIMaster 연동
지원됨
DeepSeek Harness → 설정 → 모델 → 사용자 지정 공급자 추가
데이터 신뢰도
보통
최종 확인: 2026-09-02
HumanEval 데이터셋을 로드하고 모델 코드 생성을 실행한 후 pass@1, pass@10 및 pass@100 지표를 계산합니다.
vLLM 엔진을 통해 모델을 로드하여 일괄 추론을 수행하며, 텐서 병렬 처리와 연속 배칭을 지원합니다.
YAML 파일을 사용해 작업 이름, 데이터셋 경로, 프롬프트 템플릿 및 평가 지표를 정의합니다.
각 샘플의 상세 결과와 전체 지표가 포함된 JSON 파일을 생성합니다.
Hugging Face Hub에서 DeepSeek-Coder 시리즈 모델 가중치를 직접 로드합니다.
자동 다운로드와 전처리를 지원하는 MBPP 및 APPS 코드 생성 작업이 기본 제공됩니다.
Run python main.py --model deepseek-ai/deepseek-coder-6.7b-instruct --tasks humaneval
추천 대상:모델 개발자
deepseek-coder-6.7b-base와 deepseek-coder-v2-lite-base에서 동일한 벤치마크 테스트를 각각 실행하고 pass@k를 비교합니다.
추천 대상:연구자
내부 코드 저장소를 가리키는 YAML 구성을 작성한 다음 평가를 실행하여 특정 프로그래밍 언어에서의 모델 성능을 검증합니다.
추천 대상:엔터프라이즈 개발자
vLLM 백엔드를 구성하여 여러 모델에서 MBPP와 HumanEval을 동시에 실행하고 비교 보고서를 생성합니다.
추천 대상:AI 엔지니어
Base URL
https://apimaster.ai/v1API Key 환경 변수
API key(Custom provider 配置项)모델
gpt-5.6-sol 또는 claude-sonnet-4-6 또는 deepseek-v4-pro논의 요약
사용자들은 일반적으로 DeepSeek Harness를 "모든 것이 플러그인"이라는 핵심 아이디어를 바탕으로 구축된 고도로 모듈화된 AI 코딩 에이전트 오케스트레이션 프레임워크로 이해합니다. 이에 따라 모델, 도구, 세션 로그, 에이전트 루프 및 하위 에이전트와 같은 구성 요소를 구성이나 사용자 지정 플러그인을 통해 자유롭게 교체할 수 있습니다. 주요 논의 주제는 플러그인 아키텍처를 활용해 개인화된 워크플로를 구축하고, 로컬 모델이나 Claude Code 및 Codex와 같은 타사 에이전트를 통합하며, 실제 코딩 작업에서 유연성과 안정성 사이의 균형을 맞추는 방법입니다. 또한 사용자는 Pi 및 Hermes와 같은 유사 도구와의 아키텍처 차이를 자주 논의하며, 플러그인 기반 확장이 다양한 상황에 맞게 기능을 조정하는 방식에 주목합니다.
사용자들은 모델 어댑터, 도구 등록, 세션 로그 및 에이전트 루프와 같은 핵심 부분을 프레임워크의 소스 코드를 수정하지 않고도 플러그인에 선언된 종속성, 이벤트 리스너 및 되돌릴 수 있는 등록 방식을 통해 원활하게 교체하는 방법을 논의합니다.
사용자들은 DeepSeek Harness의 완전한 플러그인 기반 레고 스타일 설계를 Pi의 미니멀한 기반이나 Claude Code의 CLI 경험과 비교하면서 컨텍스트 관리, 비용 통제 및 사용자 지정 자유도 측면의 장단점과 각 워크플로에 적합한 상황을 살펴봅니다.
사용자들은 Claude Code 또는 Codex와 같은 도구를 기본 하위 에이전트로 연결하고, 구성을 통해 하위 작업을 라우팅하며 상태와 진행 상황을 확인하여 멀티 에이전트 협업을 조율하는 방법에 주목합니다.
사용자들은 Ollama 및 Qwen과 같은 로컬 모델을 Harness에 연결하고, 웹 도구 및 iOS 자동화와 같은 도구 플러그인을 추가하며, 로컬 Web UI에서 실행하고 확장하는 설치 및 구성 경험을 공유합니다.
사용자들은 커뮤니티 플러그인 디렉터리를 활용하고 메모리, 샌드박스 또는 UI 기능을 확장하는 새 플러그인을 작성하는 방법과 플러그인 API의 안정성이 장기적인 사용자 지정 에이전트 개발에 미치는 영향을 논의합니다.
현재는 이를 "코딩 / 개발자" 카테고리로 분류하고 있으며, 페이지 설명은 공식 웹사이트와 OpenRouter 같은 공개 자료를 기반으로 작성되었습니다.
DeepSeek Harness의 확장 페이지는 이미 수집된 핵심 작업과 사용 사례를 우선적으로 제시하여, 현재 필요한 용도에 적합한지 빠르게 판단할 수 있도록 지원합니다.
현재 자료를 통해 제품이 타사 키 또는 사용자 지정 호환 엔드포인트를 지원한다는 점이 확인되었으므로, 페이지의 구성 안내에 따라 직접 계속 검증할 수 있습니다.