← ServerHealth
MTP 벤치마크
투기적 디코딩(MTP)이 실제로 얼마나 맞히는지 잽니다. 초안 위치별 채택 확률을 측정해 스텝당 토큰 수와 최적 k 를 계산합니다 — 접두사 기반이라 한 번의 측정으로 모든 k 의 값이 나옵니다. 동시성을 바꿔가며 재는 것은 초안 토큰이 배치 예산을 먹어 높은 동시성에서 이득이 깎이기 때문입니다.
모델
프리셋
MTP 가중치를 가진 모델이 없습니다. MTP 는 vLLM 이 그 아키텍처를 지원하느냐가 아니라 체크포인트에 가중치가 들어 있느냐의 문제입니다 — 본체와 함께 훈련돼야 해서, 공개자가 넣어 배포하지 않으면 쓸 수 없습니다. 가중치가 없는 모델에 투기적 디코딩을 걸려면 별도 초안 모델(eagle)이나 가중치가 필요 없는 ngram 을 씁니다.
저장된 세션
아직 저장된 세션이 없습니다. 위에서 한 번 실행하면 결과가 자동으로 남습니다.