✅ 已配置大模型速览

2026-08-14 | 环境:DSH + NVIDIA NIM + DeepSeek 官方 | 生成于 Hermes

12

NVIDIA NIM 可用模型

6

已删除(不可用)

2

推理模型

3

百万级上下文

NVIDIA Nemotron 系列

nvidia/nvidia-nemotron-nano-9b-v2

Nemotron Nano 9B

快速 · 0.8s
轻量 通用 上下文 131K

Nemotron 系列最小成员,8B 级轻量模型,响应极快。适合简单问答、分类、意图识别、实时聊天等低延迟场景。

实测:OK · 0.8s

nvidia/nemotron-3-nano-30b-a3b

Nemotron 3 Nano 30B

快速 · 0.7s
MOE 日常主力 上下文 131K

MoE 架构 30B(激活3B),速度和能力平衡很好,NVIDIA NIM 上最热门的日常对话主力模型之一。

实测:OK · 0.7s

nvidia/nemotron-3-super-120b-a12b

Nemotron 3 Super 120B

较慢 · 24s
超大 强推理 上下文 262K

120B MoE 超级模型,能力显著增强,复杂推理、代码、分析任务表现好。响应偏慢,适合对质量要求高的任务。

实测:OK · 24s

nvidia/nemotron-3-ultra-550b-a55b

Nemotron 3 Ultra 550B

极慢 · 130s
旗舰 最强能力 上下文 1M

NVIDIA NIM 旗舰模型,550B 级顶级能力 + 百万级超长上下文。适合高难度推理、长文档分析。响应极慢(约2分钟),属正常现象。

实测:OK · 130s

Meta Llama 系列

meta/llama-3.1-8b-instruct

Llama 3.1 8B Instruct

最快 · 0.7s
最轻量 闲聊 上下文 16K

Llama 3.1 家族最小,8B 级,当前测速最快。适合高并发、低延迟的简单问答和对话。

实测:OK · 0.7s

meta/llama-3.1-70b-instruct

Llama 3.1 70B Instruct

快速 · 4s
高性能 通用全能 上下文 128K

70B 通用大模型,能力均衡全能,处理各类常规任务质量稳定,速度也不错。

实测:OK · 4s

meta/llama-3.2-11b-vision-instruct

Llama 3.2 11B Vision Instruct 🖼️

中速 · 7s
多模态视觉 看图 上下文 128K

当前清单中唯一的视觉多模态模型,能理解图片。适合图片描述、OCR、图像问答等场景。聊天时可测试上传图片。

实测:OK · 7s

第三方厂商模型

openai/gpt-oss-20b

GPT-OSS 20B 🤖

快速 · 1.4s
推理模型 逻辑/代码 上下文 131K

OpenAI 开源模型,带推理(reasoning)过程。适合逻辑题、数学、代码生成。⚠️ 注意:测试时输出长度要给足,否则只输出思考过程不输出答案。

实测:OK · 1.4s

openai/gpt-oss-120b

GPT-OSS 120B 🤖

较慢 · 32s
推理模型 复杂推理 上下文 128K

OpenAI 开源 120B 推理模型,能力更强,适合复杂推理和长代码任务。响应较慢,建议 max_tokens 设置充足。

实测:OK · 32s

stepfun-ai/step-3.7-flash

Step 3.7 Flash(阶跃星辰)

快速 · 2.6s
中文友好 长上下文 上下文 256K

阶跃星辰 Flash 版,中文能力不错,256K 长上下文,适合快速中文问答和长文档处理。

实测:OK · 2.6s

z-ai/glm-5.2

GLM-5.2(智谱 AI)

中速 · 2s
中文强 百万上下文 上下文 1M

智谱 GLM-5.2,中文能力强,百万级超长上下文,适合长文档分析和中文内容生成。

实测:OK · 2s

minimaxai/minimax-m3

MiniMax-M3

最快 · 0.6s
性价比 百万上下文 上下文 1M

MiniMax M3,测速最快的模型之一(0.6s),同时支持百万级上下文,性价比很高。

实测:OK · 0.6s

已删除(不可用 / 已下架)

meta/llama-3.2-90b-vision-instruct

❌ 超时无响应 (240s)

meta/llama-3.3-70b-instruct

❌ 超时无响应 (240s)

moonshotai/kimi-k2.6

❌ HTTP 404(函数不存在)

nvidia/nemotron-3-nano-omni-30b-a3b-reasoning

❌ HTTP 404

mistralai/mistral-small-4-119b-2603

❌ HTTP 410(已下架)

stepfun-ai/step-3.5-flash

❌ HTTP 410(已下架)

🔌 通道配置

llm-pi-ai → nvidia 12 模型 · 全部连通 ✅
agent-default-model → deepseek-official deepseek-v4-flash · 连通 ✅