Hugging Face Responses API 怎么同时发送文本和图片输入
想让 Hugging Face Responses API 同时理解一段说明和一张图片,关键不是把图片地址拼到文本里,而是把两者放进同一个 user 消息的 content 数组:文字使用 input_text,图片使用 input_image,图片地址放在 image_url。客户端再把 base_url 指向 Hugging Face Router,并使用有 Inference Providers 权限的 HF_TOKEN。
最小可行结构是“一个 Responses API 请求 + 一个 content 数组 + 两个内容部件”。文本负责提出任务,图片负责提供视觉上下文;如果返回 401/403,先查令牌权限,如果返回 400,再查 content 结构、模型能力和图片 URL。
input_text与input_image必须作为同一条用户输入的 content 部件发送。image_url应是推理服务端可以访问的 HTTPS 地址,不能只在本机浏览器可见。- 排查时把令牌、模型路由、图片可达性和输出读取分开,避免用错方向。
先把多模态请求边界拆开
Responses API 的输入模型与只传一段字符串不同。调用方仍然使用 OpenAI SDK 的客户端,但目标地址改成 Hugging Face 的兼容路由;真正的多模态部分位于 input 数组内。数组元素声明角色为 user,其 content 再列出文本和图片。
下面的示例故意把图片地址写成占位地址。实际使用时,应替换为推理服务端能够通过 HTTPS 访问的图片 URL;不要把本地路径如 /Users/me/photo.jpg 直接填进 image_url。

用一个 content 数组发送文本和图片
安装 openai 后,可以先用最小请求确认结构是否正确。代码中的中文注释只解释关键边界,不把令牌写入源码:
import os
from openai import OpenAI
client = OpenAI(
# Hugging Face 的 OpenAI 兼容路由
base_url="https://router.huggingface.co/v1",
# 令牌从环境变量读取,避免进入代码仓库
api_key=os.environ["HF_TOKEN"],
)
response = client.responses.create(
# 选择支持视觉输入的模型,具体可用模型以当前路由为准
model="Qwen/Qwen2.5-VL-7B-Instruct",
input=[
{
"role": "user",
"content": [
# 文本提出要模型回答的任务
{"type": "input_text", "text": "请描述图片中的主要对象,并指出一个可观察的细节。"},
{
# 图片必须通过推理服务可访问的 URL 提供
"type": "input_image",
"image_url": "https://cdn.example.com/demo/scene.jpg",
},
],
}
],
)
# output_text 是读取文本答案的便捷字段
print(response.output_text)
这段代码有四个容易混淆的点:base_url 决定请求发往 Hugging Face;model 决定推理模型;content 是内容部件列表;image_url 只是图片资源地址,不是图片二进制本身。官方示例也采用这种把文本和视觉内容混在一个 input 数组中的形式。
为什么 400、401 和图片读取失败不是同一个问题
多模态调用失败时,先看错误落在哪一层。401 或 403 通常指向令牌无效、权限不足或账户没有可用的 Inference Providers 访问能力;这时改 content 结构没有意义。400 更常见于字段层级、内容类型拼写、模型不接受视觉输入,或者请求体不符合当前接口约定。
请求已经被接受但模型无法理解图片时,优先检查图片 URL:是否为完整的 HTTPS 地址、是否需要登录、是否会跳转到不可访问的页面、响应是否真的是图片,以及外部服务是否限制了抓取。浏览器能打开并不等于推理服务所在网络一定能读取。
| 现象 | 优先检查 | 不要先做的事 |
|---|---|---|
| 401/403 | HF_TOKEN、Inference Providers 权限、账户额度 | 反复改 input 数组 |
| 400 | role、content、input_text、input_image、模型 ID | 先怀疑图片内容 |
| 图片无法解析 | HTTPS、匿名访问、响应类型和图片大小 | 只在本机浏览器里测试 |
| 有响应但取不到答案 | 响应对象和 output_text 的读取方式 | 假设所有结果都在自定义字段里 |
把鉴权、模型与图片可达性列入排查清单
安全上,图片是外部输入,令牌是访问凭据,模型与 provider 是路由依赖,四者不应混成一个“接口不稳定”的结论。生产调用至少记录请求时间、模型标识、provider(如果显式指定)和错误类型;不要记录 HF_TOKEN,也不要把含个人信息的原图复制进日志。

如果需要固定 provider,官方文档允许把 provider 后缀附在模型 ID 后;不固定时由路由按默认策略选择可用 provider。这个选择可能影响延迟、费用和模型可用性,所以先用不带私有参数的最小请求跑通,再根据业务需要收紧路由。图片方面则优先使用短时效、最小权限的资源代理,避免把永久公开的敏感图片地址直接交给第三方推理服务。
相关问题
能不能把图片放进普通字符串里?
不建议。普通字符串只表达文本;视觉输入应使用 input_image 内容部件,并把可访问地址放进 image_url。
本地图片路径可以直接传吗?
不可以。服务端无法读取调用机器的本地路径。应先放到合适的图片服务,或使用当前接口明确支持的可传输形式,并保证请求格式符合官方文档。
为什么同样的代码换模型后失败?
Responses API 的请求形状可以保持不变,但模型是否支持视觉输入、provider 是否提供该模型以及账户是否有额度,都会变化。先查模型能力和当前 provider 状态,再判断代码是否需要修改。
小结:同时发送文本和图片的核心是同一个 content 数组里的两种部件,而不是拼接字符串。先固定客户端与输入契约,再分层检查令牌、模型路由、图片可达性和输出字段,排错会快很多。参考:Hugging Face Responses API 官方文档。
Go 多个发送方共用 channel 时怎么协调安全关闭
- 上一篇
- Go 多个发送方共用 channel 时怎么协调安全关闭
- 下一篇
- Go io.LimitReader 怎么限制上传读取量
-
- 科技周边 · 人工智能 | 1小时前 |
- OpenAI Responses API 如何区分 output_text 和完整输出项
- 277浏览 收藏
-
- 科技周边 · 人工智能 | 2小时前 | openai · function calling · 结构化输出 · Responses API · OpenAI JSON Schema 工具调用 Responses API Structured Outputs
- OpenAI Responses API 如何让工具调用返回结构化结果
- 274浏览 收藏
-
- 科技周边 · 人工智能 | 5小时前 | 人工智能 · 模型路由 · 容错设计 · API降级 · 模型降级 Responses API GPT-6 Astra OpenAI API 限量开放
- GPT-6 Astra API 限量开放时如何设计模型降级路径
- 192浏览 收藏
-
- 科技周边 · 人工智能 | 8小时前 | 人工智能 · Hugging Face · LoRA · 大模型微调 · LoRa 微调数据集 对话格式 chat template messages
- LoRA 微调数据集里为什么要保留一致的对话格式
- 426浏览 收藏
-
- 科技周边 · 人工智能 | 9小时前 |
- AI 评测集怎么同时记录准确率和拒答质量
- 385浏览 收藏
-
- 科技周边 · 人工智能 | 11小时前 |
- Prompt 缓存命中率下降时怎么查前缀是否稳定
- 487浏览 收藏
-
- 科技周边 · 人工智能 | 12小时前 |
- AI 输出 JSON 偶尔多出 Markdown 围栏怎么做容错解析
- 398浏览 收藏
-
- 科技周边 · 人工智能 | 16小时前 | 人工智能 · 性能排查 · 模型量化 · 本地推理 model quantization KV Cache
- 本地大模型量化后回答变慢怎么区分显存和上下文瓶颈
- 433浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 41次使用
-
- SuperCLUE
- SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
- 191次使用
-
- C-Eval
- 深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
- 129次使用
-
- AI Prompt Library
- 探索AI Prompt Library免费资源库,涵盖营销、写作及多场景AI提示词。兼容ChatGPT、Claude等工具,一键复制优化输出,提升工作效率。
- 56次使用
-
- Generrated
- Generrated汇集9300+张DALL·E生成图像及对应提示词,支持查看完整图集、对比DALL·E 2与3版本差异,是AI绘图新手学习Prompt设计与获取创作灵感的实用工具。
- 42次使用
-
- 本地大模型反复输出同一句话怎么调整生成参数
- 2026-09-06 501浏览
-
- Python 调用大模型时如何用结构化输出校验 JSON:从解析失败到可重试
- 2026-08-29 501浏览
-
- AI写作工具免费版安装教程(含豆包Clawdbot)
- 2026-05-30 501浏览
-
- WPS AI能自动生成PPT吗?输入主题一键制作演示文稿
- 2026-05-27 501浏览
-
- Canva手机闪退解决方法及适配指南
- 2026-05-25 501浏览

