多模态
本页说明对话接口的多模态输入能力。SilvaMux 对多模态内容透传给模型侧,能否处理取决于模型本身。
图片输入(vision)
支持 OpenAI vision 格式,在 messages 的 content 中传入 image_url:
curl https://www.silvamux.com/api/v1/chat/completions \
-H "Authorization: Bearer $SILVAMUX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "minimax-m3",
"messages": [
{
"role": "user",
"content": [
{"type": "text", "text": "这张图里有什么?"},
{"type": "image_url", "image_url": {"url": "https://example.com/cat.jpg"}}
]
}
]
}'
image_url.url可以是公网 URL,或 base64 编码(data:image/jpeg;base64,...)。- 平台不解析也不剥离图片内容,原样转发给模型侧。
- 是否支持图片输入由模型决定(如部分多模态模型支持,纯文本模型会报错)。
音频输入
支持 OpenAI audio 格式,在 content 中传入 input_audio:
{
"type": "input_audio",
"input_audio": {"data": "<base64>", "format": "wav"}
}
- 平台透传,能否处理由模型决定。
- 音频 token 按普通输入 token 计价(无独立多模态单价)。