vLLM 추론 서버와 임베딩 서버의 상태를 확인하고, 필요한 모델을 켜고 끄며 응답 속도를 테스트합니다.

rtx-spark수집 중…
CPU–
RAM–
GPU–
VRAM–
h200-spark수집 중…
CPU–
RAM–
GPU–
VRAM–

상태 확인 중…

대기· 7

Gemma4 26B

rtx-gemma-26b.dtoniclab.cloud

–
모델
–
KV 캐시
–
vLLM
–
최소 가용 동시성
확인 중…
Gemma4 31B

rtx-gemma-31b.dtoniclab.cloud

–
모델
–
KV 캐시
–
vLLM
–
최소 가용 동시성
확인 중…
GPT-OSS 20B

rtx-gpt-oss-20b.dtoniclab.cloud

–
모델
–
KV 캐시
–
vLLM
–
최소 가용 동시성
확인 중…
Qwen3.6 27B

rtx-qwen-27b.dtoniclab.cloud

–
모델
–
KV 캐시
–
vLLM
–
최소 가용 동시성
확인 중…
Qwen3.6 27B (text)

rtx-qwen-27b-text.dtoniclab.cloud

–
모델
–
KV 캐시
–
vLLM
–
최소 가용 동시성
확인 중…
Qwen3.6 27B (멀티모달)

rtx-qwen-27b-mm.dtoniclab.cloud

–
모델
–
KV 캐시
–
vLLM
–
최소 가용 동시성
확인 중…
Qwen3.8 27B (멀티모달)

rtx-qwen38-27b.dtoniclab.cloud

–
모델
–
KV 캐시
–
vLLM
–
최소 가용 동시성
확인 중…

대기· 5

Qwen3.6 35B-A3B원격

https://dtoniclab.proxy.ainexus.ktcloud.com/qwen3.6-35b-a3b-fp8

–
모델
–
KV 캐시
–
vLLM
–
최소 가용 동시성
확인 중…
Gemma4 31B-IT원격

https://dtoniclab.proxy.ainexus.ktcloud.com/gemma-4-31b-it-fp8

–
모델
–
KV 캐시
–
vLLM
–
최소 가용 동시성
확인 중…
Qwen3.8 27B원격

https://dtoniclab.proxy.ainexus.ktcloud.com/qwen38-27b-fp8

–
모델
–
KV 캐시
–
vLLM
–
최소 가용 동시성
확인 중…
Qwen3.6 27B원격

https://dtoniclab.proxy.ainexus.ktcloud.com/qwen3.6-27b-fp8

–
모델
–
KV 캐시
–
vLLM
–
최소 가용 동시성
확인 중…
GPT-OSS 120B원격

https://dtoniclab.proxy.ainexus.ktcloud.com/gpt-oss-120b

–
모델
–
KV 캐시
–
vLLM
–
최소 가용 동시성
확인 중…

추론 테스트

같은 프롬프트를 선택한 모델들에 동시에 보내 스트리밍하며 측정하고, 응답·생각 과정을 함께 보여줍니다.

모델 선택
rtx-spark
h200-spark
stacked

켜져 있는 모델이 없습니다. 위 카드에서 모델을 켠 뒤 선택하세요.

측정 기록

추론 테스트를 돌릴 때마다 자동으로 쌓입니다. 조건이 다르면 숫자를 나란히 두는 게 의미가 없어, max_tokens 와 생각 과정 설정을 함께 적어 둡니다.

아직 기록이 없습니다. 위에서 추론 테스트를 실행하면 여기에 쌓입니다.

임베딩

EmbeddingGemma 300MCPU상시

rtx-embed.dtoniclab.cloud

–
차원
–
정밀도
–
RAM
–
코어
–
texts/s
확인 중…
KoE5CPU원격

https://dtoniclab.proxy.ainexus.ktcloud.com/v1/embeddings

–
차원
–
정밀도
–
RAM
–
코어
–
texts/s
확인 중…
multilingual-E5 LargeCPU원격

https://dtoniclab.proxy.ainexus.ktcloud.com/v1/embeddings

–
차원
–
정밀도
–
RAM
–
코어
–
texts/s
확인 중…
Qwen3 Embedding 4BCPU원격

https://dtoniclab.proxy.ainexus.ktcloud.com/v1/embeddings

–
차원
–
정밀도
–
RAM
–
코어
–
texts/s
확인 중…
BGE Reranker v2 M3CPU재순위원격

https://dtoniclab.proxy.ainexus.ktcloud.com/v1/rerank

–
차원
–
정밀도
–
RAM
–
코어
–
texts/s
확인 중…
모델
직접 유사도 계산

번호가 붙은 각 칸에 문장을 하나씩 넣으면, 아래 표에서 그 번호끼리의 코사인 유사도를 보여줍니다. 줄마다 접두사를 따로 고를 수 있습니다 — 1번을 질의용, 나머지를 문서용으로 두면 실제 검색 조건이 됩니다. 최대 12개. 입력은 모델마다 따로 기억됩니다.

1.
2.
3.
4.
모델을 고르세요

음성 인식 테스트

오디오 파일을 올리면 전사와 함께 누가(화자) · 언제(시각) · 무엇을(내용) 을 한 번의 추론으로 받습니다. 파일은 브라우저에서 모델로 바로 보내며 서버에 저장하지 않습니다.

머신 선택

음성 인식 서버가 꺼져 있습니다. 위 머신 구획의 VibeVoice ASR 카드에서 켜면 테스트할 수 있습니다.

* 엔드포인트가 아직 배포되지 않았거나 CORS가 막혀 있으면 “응답 없음(빨간불)”으로 표시됩니다. 테스트는 브라우저에서 각 서버로 직접 스트리밍 요청해 측정합니다. 모델을 켜면 컨테이너 기동과 가중치 적재에 수 분이 걸려, 그동안은 “로딩 중”으로 표시됩니다.