WAND wiki
최근 문서

검색 결과가 없습니다. 모델명이나 다른 키워드로 검색해 보세요.

TokenHubLast Updated 2026-09-26

TokenHub Model List

On this page

TokenHub에서 호출 가능한 모델 목록입니다. API 호출 시 model 파라미터에는 Model (API Parameter) 값을 전달합니다. 실시간 목록과 상태는 GET /v1/models API로도 확인할 수 있습니다 (API 사용 가이드 참조).

언어 모델

Model Name Model (API Parameter) 지원 기능 Context Window 최대 입력 최대 출력
Hy3 hy3 Deep Reasoning (Preserved Thinking), Structured Output, Function Calling, Caching 256k 192k 128k
DeepSeek-V4-Flash (Vendor Direct) deepseek-v4-flash-202605 Deep Reasoning, Structured Output, Function Calling, Caching 1M 1M 384k
DeepSeek-V4-Pro (Vendor Direct) deepseek-v4-pro-202606 Deep Reasoning, Structured Output, Function Calling, Caching 1M 1M 384k
DeepSeek-V4-Flash deepseek-v4-flash Deep Reasoning, Structured Output, Function Calling, Caching 1M 1M 384k
DeepSeek-V4-Pro deepseek-v4-pro Deep Reasoning, Structured Output, Function Calling, Caching 1M 1M 384k
Deepseek-v3.2 deepseek-v3.2 Deep Reasoning, Structured Output, Function Calling 128k 96k 32k
GLM-5.3 glm-5.3 Deep Reasoning, Structured Output, Function Calling, Caching 1M 1M 128k
GLM-5.2 glm-5.2 Deep Reasoning, Structured Output, Function Calling, Caching 1M 1M 128k
GLM-5.1 glm-5.1 Deep Reasoning, Structured Output, Function Calling, Caching 200k 200k 128k
GLM-5 glm-5 Deep Reasoning, Function Calling, Caching 200k 200k 128k
GLM-5V-Turbo glm-5v-turbo Deep Reasoning, Structured Output, Function Calling, Caching 200k 200k 128k
GLM-5-Turbo glm-5-turbo Deep Reasoning, Structured Output, Function Calling, Caching 200k 200k 128k
Kimi K3 kimi-k3 Deep Reasoning, Structured Output, Function Calling, Caching 1M 1M 1M
Kimi K2.7 Code HighSpeed kimi-k2.7-code-highspeed Deep Reasoning, Structured Output, Function Calling, Caching 256k 256k 256k
Kimi K2.7 Code kimi-k2.7-code Deep Reasoning, Structured Output, Function Calling, Caching 256k 256k 256k
Kimi-K2.6 kimi-k2.6 Deep Reasoning, Structured Output, Function Calling, Caching 256k 256k 256k
Kimi-K2.5 kimi-k2.5 Deep Reasoning, Structured Output, Function Calling, Caching 256k 224k 16k
MiniMax-M3 minimax-m3 Deep Reasoning, Function Calling, Caching 1M 1M -
MiniMax-M2.7 minimax-m2.7 Deep Reasoning, Function Calling, Caching 200k 200k 128k
MiniMax-M2.5 minimax-m2.5 Deep Reasoning, Function Calling, Caching 200k 200k 128k
Hy-MT2-Plus hy-mt2-plus 번역 전용 모델. 번역과 지시문 처리를 지원합니다. 8k 4k 4k
MiMo-V2.5-Pro mimo-v2.5-pro Deep Reasoning, Structured Output, Function Calling, Caching 1M 1M 128k

임베딩 모델

Model Name Model (API Parameter) 설명 출력 차원 Context Window
Kinfra-Text-Embedding-0.6b kinfra-text-embedding-0.6b 경량 텍스트 임베딩 모델. 대규모 텍스트 검색, 지연 시간 민감, 비용 민감 시나리오에 적합합니다. 1024 32k
Kinfra-Text-Embedding-4b kinfra-text-embedding-4b 고품질 텍스트 임베딩 모델. 고품질 텍스트 검색과 심층 시맨틱 이해 시나리오에 적합합니다. 2560 32k
Kinfra-VL-Embedding-2b kinfra-vl-embedding-2b 경량 멀티모달 임베딩 모델. 텍스트, 이미지, 영상 입력을 지원하며 멀티모달 온라인 검색, 영상 검색 등 응답 속도 우선 시나리오에 적합합니다. 2048 32k
Kinfra-VL-Embedding-8b kinfra-vl-embedding-8b 고정밀 멀티모달 임베딩 모델. 텍스트, 이미지, 영상 입력을 지원하며 고정밀 멀티모달 검색 등 정확도 우선 시나리오에 적합합니다. 4096 32k

위 모델들은 중국어, 영어, 일본어, 한국어, 프랑스어, 독일어, 러시아어, 포르투갈어, 스페인어를 포함한 30개 이상의 주요 언어를 지원합니다.

지원 기능 설명

기능 설명
Deep Reasoning 최종 응답을 생성하기 전에 먼저 Chain-of-Thought 방식으로 문제를 단계별로 분석하고 분해합니다. 수학, 논리 추론, 코드 생성 등 복잡한 작업의 응답 정확도를 높입니다.
Structured Output JSON Schema 등 지정된 형식의 구조화된 데이터를 출력합니다. 정보 추출, 데이터 채우기, API 응답 구성 등 다운스트림 프로그램이 바로 파싱해야 하는 시나리오에 적합합니다.
Function Calling 추론 과정에서 사용자 의도에 따라 사전 정의된 외부 도구나 API를 자동으로 식별하고 호출합니다. 데이터베이스 조회, 서드파티 서비스 호출 등의 확장 동작을 지원합니다.
Caching 이전 요청의 컨텍스트 계산 결과를 재사용해 중복 계산을 줄입니다. 응답 속도 향상과 호출 비용 절감 효과가 있습니다.

사용 안내

  • 모델별 상세 요청 파라미터는 Language Model API와 Embedding Model 문서를 참조하세요.
  • GET /v1/models 응답에서 status가 pre-offline인 모델은 서비스 종료 예정입니다. 신규 연동에는 online 상태 모델을 사용하세요.