切换语言

视觉语言模型

向视觉语言模型发送图像,用于理解、描述与分析。

视觉语言模型(VLM)可同时处理图像与文本。在 messages 中使用 image_url 类型的内容,即可与文本一起传入图像。

支持的模型

模型 ID提供方
moonshotai/Kimi-K2.6Moonshot AI
Qwen/Qwen3.5-397B-A17B阿里通义
nvidia/Nemotron-3-Nano-Omni-30B-A3BNVIDIA

完整模型列表见 模型目录

通过 URL 传图

from openai import OpenAI

client = OpenAI(
    base_url="https://api-inference.bitdeer.ai/v1",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="moonshotai/Kimi-K2.6",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "image_url",
                    "image_url": {"url": "https://example.com/photo.jpg"},
                },
                {
                    "type": "text",
                    "text": "Describe what you see in this image.",
                },
            ],
        }
    ],
    max_tokens=512,
)

print(response.choices[0].message.content)

通过 Base64 传图

import base64

with open("photo.jpg", "rb") as f:
    b64 = base64.b64encode(f.read()).decode()

response = client.chat.completions.create(
    model="moonshotai/Kimi-K2.6",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "image_url",
                    "image_url": {"url": f"data:image/jpeg;base64,{b64}"},
                },
                {
                    "type": "text",
                    "text": "What text is present in this image?",
                },
            ],
        }
    ],
    max_tokens=512,
)

多图

单次请求可发送多张图像:

response = client.chat.completions.create(
    model="moonshotai/Kimi-K2.6",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "image_url", "image_url": {"url": "https://example.com/img1.jpg"}},
                {"type": "image_url", "image_url": {"url": "https://example.com/img2.jpg"}},
                {"type": "text", "text": "Compare these two images."},
            ],
        }
    ],
    max_tokens=512,
)

说明

  • Base64 图像建议控制在约 1 MB 以内,避免超时。
  • 图像 token 与文本 token 一并计费。
  • 视觉输入同样支持流式输出。

最后更新于

本页目录

视觉语言模型 · Bitdeer AI