视觉语言模型
向视觉语言模型发送图像,用于理解、描述与分析。
视觉语言模型(VLM)可同时处理图像与文本。在 messages 中使用 image_url 类型的内容,即可与文本一起传入图像。
支持的模型
| 模型 ID | 提供方 |
|---|---|
moonshotai/Kimi-K2.6 | Moonshot AI |
Qwen/Qwen3.5-397B-A17B | 阿里通义 |
nvidia/Nemotron-3-Nano-Omni-30B-A3B | NVIDIA |
完整模型列表见 模型目录。
通过 URL 传图
通过 Base64 传图
多图
单次请求可发送多张图像:
说明
- Base64 图像建议控制在约 1 MB 以内,避免超时。
- 图像 token 与文本 token 一并计费。
- 视觉输入同样支持流式输出。
最后更新于