> ## Documentation Index
> Fetch the complete documentation index at: https://wand.tencentpoc.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Model List

> TokenHub에서 제공하는 언어 모델과 임베딩 모델의 목록, 지원 기능, 컨텍스트 길이를 정리합니다.

TokenHub에서 호출 가능한 모델 목록입니다. API 호출 시 `model` 파라미터에는 Model (API Parameter) 값을 전달합니다. 실시간 목록과 상태는 `GET /v1/models` API로도 확인할 수 있습니다 ([API 사용 가이드](/tokenhub/api-usage) 참조).

## 언어 모델

| Model Name                        | Model (API Parameter)      | 지원 기능                                                                             | Context Window | 최대 입력 | 최대 출력 |
| --------------------------------- | -------------------------- | --------------------------------------------------------------------------------- | -------------- | ----- | ----- |
| Hy3                               | `hy3`                      | Deep Reasoning (Preserved Thinking), Structured Output, Function Calling, Caching | 256k           | 192k  | 128k  |
| DeepSeek-V4-Flash (Vendor Direct) | `deepseek-v4-flash-202605` | Deep Reasoning, Structured Output, Function Calling, Caching                      | 1M             | 1M    | 384k  |
| DeepSeek-V4-Pro (Vendor Direct)   | `deepseek-v4-pro-202606`   | Deep Reasoning, Structured Output, Function Calling, Caching                      | 1M             | 1M    | 384k  |
| DeepSeek-V4-Flash                 | `deepseek-v4-flash`        | Deep Reasoning, Structured Output, Function Calling, Caching                      | 1M             | 1M    | 384k  |
| DeepSeek-V4-Pro                   | `deepseek-v4-pro`          | Deep Reasoning, Structured Output, Function Calling, Caching                      | 1M             | 1M    | 384k  |
| Deepseek-v3.2                     | `deepseek-v3.2`            | Deep Reasoning, Structured Output, Function Calling                               | 128k           | 96k   | 32k   |
| GLM-5.3                           | `glm-5.3`                  | Deep Reasoning, Structured Output, Function Calling, Caching                      | 1M             | 1M    | 128k  |
| GLM-5.2                           | `glm-5.2`                  | Deep Reasoning, Structured Output, Function Calling, Caching                      | 1M             | 1M    | 128k  |
| GLM-5.1                           | `glm-5.1`                  | Deep Reasoning, Structured Output, Function Calling, Caching                      | 200k           | 200k  | 128k  |
| GLM-5                             | `glm-5`                    | Deep Reasoning, Function Calling, Caching                                         | 200k           | 200k  | 128k  |
| GLM-5V-Turbo                      | `glm-5v-turbo`             | Deep Reasoning, Structured Output, Function Calling, Caching                      | 200k           | 200k  | 128k  |
| GLM-5-Turbo                       | `glm-5-turbo`              | Deep Reasoning, Structured Output, Function Calling, Caching                      | 200k           | 200k  | 128k  |
| Kimi K3                           | `kimi-k3`                  | Deep Reasoning, Structured Output, Function Calling, Caching                      | 1M             | 1M    | 1M    |
| Kimi K2.7 Code HighSpeed          | `kimi-k2.7-code-highspeed` | Deep Reasoning, Structured Output, Function Calling, Caching                      | 256k           | 256k  | 256k  |
| Kimi K2.7 Code                    | `kimi-k2.7-code`           | Deep Reasoning, Structured Output, Function Calling, Caching                      | 256k           | 256k  | 256k  |
| Kimi-K2.6                         | `kimi-k2.6`                | Deep Reasoning, Structured Output, Function Calling, Caching                      | 256k           | 256k  | 256k  |
| Kimi-K2.5                         | `kimi-k2.5`                | Deep Reasoning, Structured Output, Function Calling, Caching                      | 256k           | 224k  | 16k   |
| MiniMax-M3                        | `minimax-m3`               | Deep Reasoning, Function Calling, Caching                                         | 1M             | 1M    | -     |
| MiniMax-M2.7                      | `minimax-m2.7`             | Deep Reasoning, Function Calling, Caching                                         | 200k           | 200k  | 128k  |
| MiniMax-M2.5                      | `minimax-m2.5`             | Deep Reasoning, Function Calling, Caching                                         | 200k           | 200k  | 128k  |
| Hy-MT2-Plus                       | `hy-mt2-plus`              | 번역 전용 모델. 우수한 번역 성능과 명령 수행 능력을 제공합니다.                                             | 8k             | 4k    | 4k    |
| MiMo-V2.5-Pro                     | `mimo-v2.5-pro`            | Deep Reasoning, Structured Output, Function Calling, Caching                      | 1M             | 1M    | 128k  |

## 임베딩 모델

| Model Name                 | Model (API Parameter)        | 설명                                                                                 | 출력 차원 | Context Window |
| -------------------------- | ---------------------------- | ---------------------------------------------------------------------------------- | ----- | -------------- |
| Kinfra-Text-Embedding-0.6b | `kinfra-text-embedding-0.6b` | 경량 텍스트 임베딩 모델. 대규모 텍스트 검색, 지연 시간 민감, 비용 민감 시나리오에 적합합니다.                            | 1024  | 32k            |
| Kinfra-Text-Embedding-4b   | `kinfra-text-embedding-4b`   | 고품질 텍스트 임베딩 모델. 고품질 텍스트 검색과 심층 시맨틱 이해 시나리오에 적합합니다.                                 | 2560  | 32k            |
| Kinfra-VL-Embedding-2b     | `kinfra-vl-embedding-2b`     | 경량 멀티모달 임베딩 모델. 텍스트, 이미지, 비디오 입력을 지원하며 멀티모달 온라인 검색, 비디오 검색 등 응답 속도 우선 시나리오에 적합합니다. | 2048  | 32k            |
| Kinfra-VL-Embedding-8b     | `kinfra-vl-embedding-8b`     | 고정밀 멀티모달 임베딩 모델. 텍스트, 이미지, 비디오 입력을 지원하며 고정밀 멀티모달 검색 등 정확도 우선 시나리오에 적합합니다.          | 4096  | 32k            |

<Note>
  위 모델들은 중국어, 영어, 일본어, 한국어, 프랑스어, 독일어, 러시아어, 포르투갈어, 스페인어를 포함한 30개 이상의 주요 언어를 지원합니다.
</Note>

## 지원 기능 설명

| 기능                | 설명                                                                                                     |
| ----------------- | ------------------------------------------------------------------------------------------------------ |
| Deep Reasoning    | 최종 응답을 생성하기 전에 먼저 Chain-of-Thought 방식으로 문제를 단계별로 분석하고 분해합니다. 수학, 논리 추론, 코드 생성 등 복잡한 작업의 응답 정확도를 높입니다.  |
| Structured Output | JSON Schema 등 지정된 형식의 구조화된 데이터를 출력합니다. 정보 추출, 데이터 채우기, API 응답 구성 등 다운스트림 프로그램이 바로 파싱해야 하는 시나리오에 적합합니다. |
| Function Calling  | 추론 과정에서 사용자 의도에 따라 사전 정의된 외부 도구나 API를 자동으로 식별하고 호출합니다. 데이터베이스 조회, 서드파티 서비스 호출 등의 확장 동작을 지원합니다.         |
| Caching           | 이전 요청의 컨텍스트 계산 결과를 재사용해 중복 계산을 줄입니다. 응답 속도 향상과 호출 비용 절감 효과가 있습니다.                                      |

## 주의사항

* 모델별 상세 요청 파라미터는 [Language Model API](https://www.tencentcloud.com/document/product/1300/80632)와 [Embedding Model](https://www.tencentcloud.com/document/product/1300/81297) 문서를 참조하세요.
* `GET /v1/models` 응답에서 `status`가 `pre-offline`인 모델은 서비스 종료 예정입니다. 신규 연동에는 `online` 상태 모델을 사용하세요.
