切换语言

音频输入

通过 input_audio 发送音频,用于转写、摘要与分析。

messages 中使用 input_audio 内容类型,向 nvidia/Nemotron-3-Nano-Omni-30B-A3B 传入音频,并可附带文本指令。

支持的模型

模型 ID提供方
nvidia/Nemotron-3-Nano-Omni-30B-A3BNVIDIA

图像输入见 视觉指南。完整模型列表见 模型目录

通过 URL 传音频

from openai import OpenAI

client = OpenAI(
    base_url="https://api-inference.bitdeer.ai/v1",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="nvidia/Nemotron-3-Nano-Omni-30B-A3B",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "input_audio",
                    "input_audio": {
                        "data": "https://example.com/meeting.wav",
                        "format": "wav",
                    },
                },
                {
                    "type": "text",
                    "text": "请转写这段音频并总结要点。",
                },
            ],
        }
    ],
    max_tokens=1024,
)

print(response.choices[0].message.content)

说明

  • input_audio.data 可为公开 URL 或 Base64 编码的音频数据。
  • input_audio.format 需与文件容器/编码一致(例如 wavmp3)。
  • 设置 stream=true 时可对流式输出音频输入进行推理。

最后更新于

本页目录

音频输入 · Bitdeer AI