跳到主要内容

AI 图片理解

将图片和问题发送给支持视觉输入的模型,用于识别文字、描述画面、分析截图或提取图片中的信息。

使用前,请先在 Quicker 的 设置 → AI 中配置服务、模型和“图片理解”任务场景,并确认候选模型明确支持图片输入。配置方式见统一 AI 服务与模型设置

当前模块定义

sys:aiVision图片处理Action
标准模块
输入 10 · 输出 11 · 枚举 3

输入参数

  • 图片imageImage必填

    要理解的图片变量;上限 4000 万像素且 PNG 编码后不超过 10 MiB。

    填写 仅变量
  • 问题或任务questionText必填

    告诉 AI 要观察或回答什么,例如“提取图片中的全部文字”。

    填写 输入或变量
  • 辅助文本contextTextText可选

    与图片一起提供的背景信息;不需要时留空。

    填写 输入或变量
  • 系统提示词systemPromptText可选

    可选的全局回答规则,例如“只返回识别出的文字”。

    填写 输入或变量
  • AI 任务场景useCaseIdText可选

    选择支持图片输入的 AI 任务场景。动作只保存场景 ID。

    填写 输入或变量默认 image.understanding
    图片理解默认image.understanding
  • 输出方式outputModeEnum可选

    直接返回适合后台流程;交互调整会打开 Markdown 窗口,可实时查看、继续追问并显式采用回答。

    填写 输入或变量默认 direct
    直接返回默认direct
    交互调整interactive
  • 任务场景缺失时missingUseCaseBehaviorEnum可选

    自定义任务场景不存在时,使用内置图片理解任务场景或直接失败。

    填写 输入或变量默认 UseBaseUseCase
    使用基础场景默认UseBaseUseCase
    执行失败Fail
  • 温度temperatureNumber可选

    留空时不向模型发送 Temperature;仅在确认模型支持时填写。

    填写 输入或变量
  • 最大输出 TokenmaxOutputTokensInteger可选
    填写 输入或变量默认 0
  • 失败后停止stopIfFailBoolean可选

    失败后是否停止动作

    填写 固定输入默认 true

输出参数

  • 是否成功isSuccessBoolean

    操作是否成功

  • 回答resultText
  • 实际模型modelText
  • 输入 TokeninputTokensInteger
  • 缓存输入 TokencachedInputTokensInteger

    服务商报告的缓存命中输入 Token;未提供时为 0。

  • 输出 TokenoutputTokensInteger
  • 总 TokentotalTokensInteger
  • 结束原因finishReasonText
  • 调用标识invocationIdText
  • 实际任务场景resolvedUseCaseIdText
  • 是否回退场景useCaseFallbackUsedBoolean

基本用法

  1. 将截图、剪贴板图片或其它图片变量传给“图片”。
  2. 在“问题或任务”中说明希望模型观察或回答的内容。
  3. 如有必要,填写辅助文本和系统提示词。
  4. 从“回答”输出中取得结果。

例如,把截图步骤的图片输出传给本模块,在“问题或任务”中填写“提取图片中的全部文字,保持原有段落顺序”,即可把识别结果传给后续文本步骤。

输出方式

“直接返回”适合自动化流程。“交互调整”会打开 Markdown 对话窗口,流式显示回答并允许基于当前图片继续追问;只有点击“采用当前回答”才会输出结果,关闭或取消窗口会按用户取消结束。

图片与模型限制

  • 图片不得超过 4000 万像素;转换为 PNG 后不得超过 10 MiB。超过限制时请先缩小或压缩图片。
  • 候选模型必须在 AI 设置中明确标记为支持图片输入。能力为未知或不支持的模型不会满足本模块要求。
  • 动作只保存任务场景 ID,不保存 API Key。换设备后需要重新填写本机凭据。
  • 图片、问题和辅助文本会发送给实际选中的 AI 服务商,请确认内容符合相应的隐私与合规要求。