提示词教程

多模态提示词设计教程:让AI看懂图、听懂话、读懂文档

发布时间:2026年08月11日 10:00:00

系统讲解多模态提示词的设计方法:图像理解、语音/音频、文档解析三大场景的输入组织、指令措辞与常见误区,配套可复用模板,帮助读者从单模态提问升级到图文音混合协作。


学习目标

完成本教程后,你将能够:

  • 理解多模态提示词的差异:与纯文本提示词相比,多模态需同时描述「输入素材」与「任务意图」
  • 设计图像理解提示词:对截图、设计稿、照片提出精准分析请求
  • 组织语音/音频提示词:转写、摘要、情绪识别、会议纪要等任务的结构化写法
  • 编写文档解析提示词:PDF/Word/表格的抽取、对比、问答范式
  • 规避常见坑:避免「图我都发了你随便看」式模糊指令

一、多模态提示词的通用结构

多模态提示词 = 素材说明 + 任务指令 + 输出约束,三者缺一不可。

【素材说明】
- 类型:{图片/音频/文档}
- 内容概述:一句话说明素材讲了什么
- 关注区域:{指定截图中的某个区域 / 音频的第X分钟 / 文档第X页}

【任务指令】
请完成:{具体任务,如:提取表格数据 / 诊断UI问题 / 总结会议结论}

【输出约束】
- 格式:{表格/JSON/分点}
- 语言:中文
- 长度:{限制}
- 禁止:{幻觉补充、超出素材的推论}

关键原则:多模态模型容易「脑补」素材中没有的信息,因此必须显式要求「仅基于给定素材回答」。

二、图像理解提示词

场景:UI/网页设计稿诊断

你是一位资深UI设计师。请分析我提供的网页设计稿截图。

任务:
1. 列出视觉层级是否合理(导航、主视觉、CTA按钮优先级)
2. 指出3个明显的可用性问题(如对比度、间距、对齐)
3. 给出改进行建议,每条标注修改位置

约束:
- 仅基于截图内容判断,不要假设未显示的部分
- 输出分点,问题用【问题】【影响】【建议】三段式
- 语言:中文

场景:实物/照片信息提取

你是一位货架巡检员。这是一张便利店货架照片。

请输出:
1. 货架上有哪些品牌/商品(逐行列出)
2. 是否有明显缺货的层位(标注位置)
3. 价签与商品是否可能错位(如能判断)

约束:仅依据照片,无法判断处写「看不清」,不要编造。

三、语音/音频提示词

场景:会议录音转写与纪要

你是一位会议记录助手。以下是会议音频的转写文本(或请直接处理音频)。

任务:
1. 整理为会议纪要,包含:时间、参会人(从对话推断)、核心议题、决议、待办(含负责人与截止日)
2. 标记讨论中的分歧点
3. 用一句话总结会议结论

约束:
- 区分「已决议」与「待确认」
- 待办必须可追踪(谁、做什么、何时)
- 输出Markdown表格

场景:情绪与语气识别

你是一位客服质检员。以下是客服通话录音转写。

请评估:
1. 客户情绪走向(平静→不满→缓和,标注转折点)
2. 客服是否出现违规表述(如承诺超出权限)
3. 改进话术建议

约束:基于文本中的具体语句给出判断,引用原话。

四、文档解析提示词

场景:PDF合同关键信息抽取

你是一位合同审核助理。请解析附件中的合同文档。

抽取字段(JSON格式):
- 甲方、乙方
- 合同金额与币种
- 起止日期
- 付款节点
- 违约责任条款摘要
- 争议解决方式

约束:
- 字段缺失时填 null,不要推测
- 金额保留原文单位
- 仅输出JSON,不要解释

场景:多文档对比

你正在对比三份产品说明书(A/B/C)。

请输出对比表:
| 维度 | A | B | C |
| 核心功能 | | | |
| 适用人群 | | | |
| 价格区间 | | | |
| 差异点 | | | |

约束:差异点须指出哪份文档独有,不要泛泛而谈。

五、常见误区

❌ 错误做法

  • 只发图不说话:「帮我看看这张图」→ 模型不知道你要什么
  • 要求超出素材:「根据行业惯例补充」→ 引入幻觉
  • 一次塞太多素材且不编号 → 模型混淆来源
  • 忽略格式约束 → 输出难以二次处理

✅ 正确做法

  • 素材先编号:图1/图2、文档A/文档B
  • 任务指令用动词开头:提取、诊断、对比、总结
  • 强制「仅基于素材」防止脑补
  • 指定机器可读格式(JSON/表格)便于下游自动化

实践作业

  1. 找一张自己的网页/海报截图,用「UI诊断」模板生成改进清单
  2. 用一段会议录音(或转写文本)生成待办表
  3. 任选两份文档做对比表,检查模型是否混淆来源

来源:综合多模态提示词工程实践与主流模型(GPT-Image、Gemini、豆包、通义)使用经验