提示词教程
多模态提示词设计教程:让AI看懂图、听懂话、读懂文档
发布时间:2026年08月11日 10:00:00系统讲解多模态提示词的设计方法:图像理解、语音/音频、文档解析三大场景的输入组织、指令措辞与常见误区,配套可复用模板,帮助读者从单模态提问升级到图文音混合协作。
学习目标
完成本教程后,你将能够:
- 理解多模态提示词的差异:与纯文本提示词相比,多模态需同时描述「输入素材」与「任务意图」
- 设计图像理解提示词:对截图、设计稿、照片提出精准分析请求
- 组织语音/音频提示词:转写、摘要、情绪识别、会议纪要等任务的结构化写法
- 编写文档解析提示词:PDF/Word/表格的抽取、对比、问答范式
- 规避常见坑:避免「图我都发了你随便看」式模糊指令
一、多模态提示词的通用结构
多模态提示词 = 素材说明 + 任务指令 + 输出约束,三者缺一不可。
【素材说明】
- 类型:{图片/音频/文档}
- 内容概述:一句话说明素材讲了什么
- 关注区域:{指定截图中的某个区域 / 音频的第X分钟 / 文档第X页}
【任务指令】
请完成:{具体任务,如:提取表格数据 / 诊断UI问题 / 总结会议结论}
【输出约束】
- 格式:{表格/JSON/分点}
- 语言:中文
- 长度:{限制}
- 禁止:{幻觉补充、超出素材的推论}
关键原则:多模态模型容易「脑补」素材中没有的信息,因此必须显式要求「仅基于给定素材回答」。
二、图像理解提示词
场景:UI/网页设计稿诊断
你是一位资深UI设计师。请分析我提供的网页设计稿截图。
任务:
1. 列出视觉层级是否合理(导航、主视觉、CTA按钮优先级)
2. 指出3个明显的可用性问题(如对比度、间距、对齐)
3. 给出改进行建议,每条标注修改位置
约束:
- 仅基于截图内容判断,不要假设未显示的部分
- 输出分点,问题用【问题】【影响】【建议】三段式
- 语言:中文
场景:实物/照片信息提取
你是一位货架巡检员。这是一张便利店货架照片。
请输出:
1. 货架上有哪些品牌/商品(逐行列出)
2. 是否有明显缺货的层位(标注位置)
3. 价签与商品是否可能错位(如能判断)
约束:仅依据照片,无法判断处写「看不清」,不要编造。
三、语音/音频提示词
场景:会议录音转写与纪要
你是一位会议记录助手。以下是会议音频的转写文本(或请直接处理音频)。
任务:
1. 整理为会议纪要,包含:时间、参会人(从对话推断)、核心议题、决议、待办(含负责人与截止日)
2. 标记讨论中的分歧点
3. 用一句话总结会议结论
约束:
- 区分「已决议」与「待确认」
- 待办必须可追踪(谁、做什么、何时)
- 输出Markdown表格
场景:情绪与语气识别
你是一位客服质检员。以下是客服通话录音转写。
请评估:
1. 客户情绪走向(平静→不满→缓和,标注转折点)
2. 客服是否出现违规表述(如承诺超出权限)
3. 改进话术建议
约束:基于文本中的具体语句给出判断,引用原话。
四、文档解析提示词
场景:PDF合同关键信息抽取
你是一位合同审核助理。请解析附件中的合同文档。
抽取字段(JSON格式):
- 甲方、乙方
- 合同金额与币种
- 起止日期
- 付款节点
- 违约责任条款摘要
- 争议解决方式
约束:
- 字段缺失时填 null,不要推测
- 金额保留原文单位
- 仅输出JSON,不要解释
场景:多文档对比
你正在对比三份产品说明书(A/B/C)。
请输出对比表:
| 维度 | A | B | C |
| 核心功能 | | | |
| 适用人群 | | | |
| 价格区间 | | | |
| 差异点 | | | |
约束:差异点须指出哪份文档独有,不要泛泛而谈。
五、常见误区
❌ 错误做法
- 只发图不说话:「帮我看看这张图」→ 模型不知道你要什么
- 要求超出素材:「根据行业惯例补充」→ 引入幻觉
- 一次塞太多素材且不编号 → 模型混淆来源
- 忽略格式约束 → 输出难以二次处理
✅ 正确做法
- 素材先编号:图1/图2、文档A/文档B
- 任务指令用动词开头:提取、诊断、对比、总结
- 强制「仅基于素材」防止脑补
- 指定机器可读格式(JSON/表格)便于下游自动化
实践作业
- 找一张自己的网页/海报截图,用「UI诊断」模板生成改进清单
- 用一段会议录音(或转写文本)生成待办表
- 任选两份文档做对比表,检查模型是否混淆来源
来源:综合多模态提示词工程实践与主流模型(GPT-Image、Gemini、豆包、通义)使用经验