2026-08-14 | 环境:DSH + NVIDIA NIM + DeepSeek 官方 | 生成于 Hermes
12
NVIDIA NIM 可用模型
6
已删除(不可用)
2
推理模型
3
百万级上下文
nvidia/nvidia-nemotron-nano-9b-v2
Nemotron Nano 9B
Nemotron 系列最小成员,8B 级轻量模型,响应极快。适合简单问答、分类、意图识别、实时聊天等低延迟场景。
实测:OK · 0.8s
nvidia/nemotron-3-nano-30b-a3b
Nemotron 3 Nano 30B
MoE 架构 30B(激活3B),速度和能力平衡很好,NVIDIA NIM 上最热门的日常对话主力模型之一。
实测:OK · 0.7s
nvidia/nemotron-3-super-120b-a12b
Nemotron 3 Super 120B
120B MoE 超级模型,能力显著增强,复杂推理、代码、分析任务表现好。响应偏慢,适合对质量要求高的任务。
实测:OK · 24s
nvidia/nemotron-3-ultra-550b-a55b
Nemotron 3 Ultra 550B
NVIDIA NIM 旗舰模型,550B 级顶级能力 + 百万级超长上下文。适合高难度推理、长文档分析。响应极慢(约2分钟),属正常现象。
实测:OK · 130s
meta/llama-3.1-8b-instruct
Llama 3.1 8B Instruct
Llama 3.1 家族最小,8B 级,当前测速最快。适合高并发、低延迟的简单问答和对话。
实测:OK · 0.7s
meta/llama-3.1-70b-instruct
Llama 3.1 70B Instruct
70B 通用大模型,能力均衡全能,处理各类常规任务质量稳定,速度也不错。
实测:OK · 4s
meta/llama-3.2-11b-vision-instruct
Llama 3.2 11B Vision Instruct 🖼️
当前清单中唯一的视觉多模态模型,能理解图片。适合图片描述、OCR、图像问答等场景。聊天时可测试上传图片。
实测:OK · 7s
openai/gpt-oss-20b
GPT-OSS 20B 🤖
OpenAI 开源模型,带推理(reasoning)过程。适合逻辑题、数学、代码生成。⚠️ 注意:测试时输出长度要给足,否则只输出思考过程不输出答案。
实测:OK · 1.4s
openai/gpt-oss-120b
GPT-OSS 120B 🤖
OpenAI 开源 120B 推理模型,能力更强,适合复杂推理和长代码任务。响应较慢,建议 max_tokens 设置充足。
实测:OK · 32s
stepfun-ai/step-3.7-flash
Step 3.7 Flash(阶跃星辰)
阶跃星辰 Flash 版,中文能力不错,256K 长上下文,适合快速中文问答和长文档处理。
实测:OK · 2.6s
z-ai/glm-5.2
GLM-5.2(智谱 AI)
智谱 GLM-5.2,中文能力强,百万级超长上下文,适合长文档分析和中文内容生成。
实测:OK · 2s
minimaxai/minimax-m3
MiniMax-M3
MiniMax M3,测速最快的模型之一(0.6s),同时支持百万级上下文,性价比很高。
实测:OK · 0.6s
meta/llama-3.2-90b-vision-instruct
❌ 超时无响应 (240s)
meta/llama-3.3-70b-instruct
❌ 超时无响应 (240s)
moonshotai/kimi-k2.6
❌ HTTP 404(函数不存在)
nvidia/nemotron-3-nano-omni-30b-a3b-reasoning
❌ HTTP 404
mistralai/mistral-small-4-119b-2603
❌ HTTP 410(已下架)
stepfun-ai/step-3.5-flash
❌ HTTP 410(已下架)