NEWTYPE · OPEN BENCHMARK · OPEN BENCHMARK
NewtypeBench — 공개 검증을 통과한 방법론
“NewtypeBench evaluates AI coding agents on full-stack feature shipping — like SWE-Bench, but for the modern AI-native stack and judged by real production tests.”
- corpus 123 tasks
- HF v0.2.2
- license BSL
- stack FastAPI · React · Vite
leaderboard — 오픈 예정
PROVEN IN PUBLIC
숫자로 말합니다
공개 벤치마크 NewtypeBench에서 이미 실증된 지표입니다.
123
공개 벤치마크 태스크 (71 backend + 52 frontend)
32,885
1회 평가 시 실행 테스트
3
태스크 소스 OSS (42.7k★ / 3.6k★ / 44k★)
v0.2.2
공개 데이터셋 — Hugging Face (BSL)
30%
프런티어 모델 실측 — Claude Opus 4.7, 20-instance smoke (binary)
123/123
스키마 검증 통과
프런티어 모델의 실측 결과 30%를 숨기지 않습니다. 최고 수준의 모델도 이 수준입니다 — 그래서 측정이 필요합니다.
EXAMPLE
평가는 이렇게 생겼습니다
자연어 스펙을 받은 에이전트가 4줄 patch를 제출하고, 하네스가 실행 결과로 자동 채점합니다.
@@ -141,6 +141,10 @@ def register_routes(router):
return ThreadListResponse(items=threads)
+ @router.get("/threads/{thread_id}/export")
+ def export_thread(thread_id: str, db=Depends(get_db)):
+ thread = get_or_404(db, Thread, thread_id)
+ return render_markdown_export(thread)- FAIL패치 적용 전 — 신규 기능 테스트 실패
- RUNpytest · Playwright 실행 중 … 32,885 tests
- PASSFAIL_TO_PASS 940 통과 ∧ PASS_TO_PASS 31,945 무회귀
직접 확인하십시오
방법론·스코어링 로직·데이터셋 전부가 공개되어 있습니다. 회사 이름은 벤치마크에 등장하지 않습니다 — 중립성 원칙입니다.
WHY THIS STACK
AI 제품을 만드는 사람들의 스택에서, AI 에이전트를 평가한다
평가 스택은 임의 선택이 아닙니다 — 각 카테고리 사용률 1위 도구로 구성했습니다.
스택 서베이 근거
| 기술 | 사용률 | 출처 |
|---|---|---|
| React | 82% | State of JS 2024 · 카테고리 1위 |
| Vite | 78.1% | State of JS 2024 · 카테고리 1위 |
| Tailwind | 62% | State of CSS 2024 · 카테고리 1위 |
| FastAPI | 38% | JetBrains 2024 · 카테고리 1위 |
─ Indeed “fastapi react” 채용 공고 16,209건
벤치마크 지형에서의 고유 축
| 벤치마크 | 측정 영역 |
|---|---|
| SWE-Bench | 성숙 라이브러리 버그픽스 |
| FullStackBench | 일반 코드 품질 |
| Terminal-Bench | CLI 작업 |
| NewtypeBench | 모던 AI-native 스택 × 풀스택 기능 shipping |