AI 图片理解
将图片和问题发送给支持视觉输入的模型,用于识别文字、描述画面、分析截图或提取图片中的信息。
使用前,请先在 Quicker 的 设置 → AI 中配置服务、模型和“图片理解”任务场景,并确认候选模型明确支持图片输入。配置方式见统一 AI 服务与模型设置。
当前模块定义
sys:aiVision输入 10 · 输出 11 · 枚举 3
输入参数
- 图片
imageImage必填要理解的图片变量;上限 4000 万像素且 PNG 编码后不超过 10 MiB。
- 问题或任务
questionText必填告诉 AI 要观察或回答什么,例如“提取图片中的全部文字”。
- 辅助文本
contextTextText可选与图片一起提供的背景信息;不需要时留空。
- 系统提示词
systemPromptText可选可选的全局回答规则,例如“只返回识别出的文字”。
- AI 任务场景
useCaseIdText可选选择支持图片输入的 AI 任务场景。动作只保存场景 ID。
图片理解默认image.understanding - 输出方式
outputModeEnum可选直接返回适合后台流程;交互调整会打开 Markdown 窗口,可实时查看、继续追问并显式采用回答。
直接返回默认direct交互调整interactive - 任务场景缺失时
missingUseCaseBehaviorEnum可选自定义任务场景不存在时,使用内置图片理解任务场景或直接失败。
使用基础场景默认UseBaseUseCase执行失败Fail - 温度
temperatureNumber可选留空时不向模型发送 Temperature;仅在确认模型支持时填写。
- 最大输出 Token
maxOutputTokensInteger可选 - 失败后停止
stopIfFailBoolean可选失败后是否停止动作
输出参数
- 是否成功
isSuccessBoolean操作是否成功
- 回答
resultText - 实际模型
modelText - 输入 Token
inputTokensInteger - 缓存输入 Token
cachedInputTokensInteger服务商报告的缓存命中输入 Token;未提供时为 0。
- 输出 Token
outputTokensInteger - 总 Token
totalTokensInteger - 结束原因
finishReasonText - 调用标识
invocationIdText - 实际任务场景
resolvedUseCaseIdText - 是否回退场景
useCaseFallbackUsedBoolean
基本用法
- 将截图、剪贴板图片或其它图片变量传给“图片”。
- 在“问题或任务”中说明希望模型观察或回答的内容。
- 如有必要,填写辅助文本和系统提示词。
- 从“回答”输出中取得结果。
例如,把截图步骤的图片输出传给本模块,在“问题或任务”中填写“提取图片中的全部文字,保持原有段落顺序”,即可把识别结果传给后续文本步骤。
输出方式
“直接返回”适合自动化流程。“交互调整”会打开 Markdown 对话窗口,流式显示回答并允许基于当前图片继续追问;只有点击“采用当前回答”才会输出结果,关闭或取消窗口会按用户取消结束。
图片与模型限制
- 图片不得超过 4000 万像素;转换为 PNG 后不得超过 10 MiB。超过限制时请先缩小或压缩图片。
- 候选模型必须在 AI 设置中明确标记为支持图片输入。能力为未知或不支持的模型不会满足本模块要求。
- 动作只保存任务场景 ID,不保存 API Key。换设备后需要重新填写本机凭据。
- 图片、问题和辅助文本会发送给实际选中的 AI 服务商,请确认内容符合相应的隐私与合规要求。