gpt-image-2 使用兼容 OpenAI Images API 的 /v1/images/generations 和 /v1/images/edits 端点;Gemini 图片模型使用 Gemini 原生 generateContent 端点。
支持的图片模型
完整模型列表和最新价格请参阅模型目录。
使用 gpt-image-2
使用 OpenAI SDK
使用 curl 生成图片
data[0].b64_json 中返回生成结果;gpt-image-2 不提供托管图片 URL。完整字段请参阅图片 API 参考。
使用 curl 编辑图片
通过/v1/images/edits 上传待编辑图片和编辑指令。该端点使用 multipart/form-data;image 为必填图片文件,mask 为可选蒙版文件。
image 支持 PNG、JPEG 和 WebP。省略 mask 时会根据提示词编辑整张图片;提供 mask 时,蒙版的透明区域是需要重绘的区域。编辑结果位于响应的 data[0].b64_json 中。完整字段请参阅编辑图片 API 参考。
使用 Gemini 图片模型
Gemini 图片模型使用以下端点。将{model} 替换为模型 ID:
generationConfig.responseModalities 中包含 "IMAGE"。响应图片位于 candidates[].content.parts[].inlineData。
使用 curl
使用 Python 并保存图片
安装 HTTP 客户端:使用 Node.js 并保存图片
Gemini 请求参数
array
必填
对话内容。文本生图时,在
parts[].text 中填写图片描述。array
必填
响应模态。使用
["TEXT", "IMAGE"] 返回文本和图片,或使用 ["IMAGE"] 仅请求图片。string
必填
模型 ID 位于 URL 路径中,而不是请求体中。例如
gemini-3-pro-image。Gemini 响应格式
inlineData.data 是 Base64 编码的图片内容。一个响应可能同时包含文本和多个图片 part,请遍历 parts,不要假设图片总是第一个元素。常见问题
返回 get_channel_failed
确认端点与模型匹配:gpt-image-2生成图片使用/v1/images/generations。gpt-image-2编辑图片使用/v1/images/edits。- Gemini 图片模型使用
/v1beta/models/{model}:generateContent。
Gemini 响应中没有图片
确认generationConfig.responseModalities 包含 "IMAGE",并检查响应中是否返回了错误或安全拦截信息。
编写有效的提示词
- 明确风格:写实摄影、油画、水彩、3D 渲染
- 加入光线细节:黄金时刻、影棚灯光、强烈阴影
- 指定构图:特写、广角、俯瞰视角、竖幅构图
- 添加质量描述:高细节、4K、专业摄影