FEATURED · 精选文章

提示词实操题:上下文工程与模板(10 题)

发布时间 / 2026/9/6 9:53:54
来源 / 创域科博编辑部
栏目 / 资讯中心
提示词实操题:上下文工程与模板(10 题) 题目结构说明:每题四部分。考点定位讲面试官到底在筛什么;答题要点讲清为什么这样写有效,落到具体机制(指令位置衰减、格式锚定、近因效应)才算答到位;可复制模板是本篇核心交付物,占位符统一用{ {变量}}形式,拿去就能接业务;追问链是写完模板后大概率跟上的问题,附一句话答法。标记:⭐ 高频(出现率过半)、🔥 近两年新增。Q1 怎么保证 LLM 稳定输出可解析的 JSON?⭐考点定位:结构化输出是生产系统的第一道坎,下游要拿 JSON 反序列化,模型随手加一句「好的,以下是结果」整条链路就挂。面试官分三层看:知不知道 API 层面有 JSON Mode / Structured Output,会不会用 schema 锚定格式,有没有失败兜底。答题要点:三层递进。第一层用 API 能力:OpenAI 的response_format、各框架的 with_structured_output,走约束解码时格式是概率上保证的,优于口头要求。第二层是 prompt 内的格式锚定:给出完整 schema、字段类型和枚举值,再给一个符合 schema 的示例,模型对「示例格式」的模仿力强于对「格式描述」的理解力。第三层是工程兜底:解析失败把报错信息拼回 prompt 重试一次(自修复),temperature 设 0 降低采样发散(推理模型不受此控温逻辑约束)。口述时点一句机制:JSON Mode 本质是把文法约束加进解码过程,合法 token 之外的 logits 直接被屏蔽。可复制模板:你是数据接口,只输出 JSON,不输出任何解释、markdown 代码块标记或多余文字。 ​ 输出 schema: { "category": "BUG" | "FEATURE" | "CONSULT" | "OTHER", "priority": 1-5 的整数, "summary": "不超过 30 字的中文概要", "needs_human": 布尔值,无法判断时为 true } ​ 规则: - 只依据工单内容判断,不臆测缺失信息;category 无法归入前三类时用 OTHER - summary 不出现「用户」「我觉得」这类主语,直接陈述事实 ​ 示例输入:APP 打开就闪退,安卓 13,重装也没用 示例输出:{"category": "BUG", "priority": 4, "summary": "安卓13启动闪退,重装无效", "needs_human": false} ​ 工单:{ {ticket_content}} 输出:追问链:「模型还是偶尔输出带 markdown 包裹的 JSON 怎么办?」- 解析前先 strip 反引号和json标记这类已知噪声,再走失败重试,不要指望 prompt 百分之百。「为什么示例要放在输入前面而不是后面?」- 最后出现的内容近因效应最强,输入贴着「输出:」能让模型立刻进入续写模式,减少自由发挥空间。「字段顺序有影响吗?」- 有,模型对 schema 开头字段的遵循度更高,最关键字段放前面。Q2 few-shot 示例怎么选、怎么排?⭐考点定位:所有人都会说「给几个例子」,面试官盯的是细节:例子从哪来、边界情况覆盖没有、顺序有没有讲究。答不出「类别要均衡、难例要放进去」的,多半没维护过线上 prompt。答题要点:讲三个机制。一是分布匹配:示例就是模型的「临时训练集」,示例的类别分布和标注风格会被直接模仿,五条示例全是正面情感,模型会把中性也判成正面,所以要类别均衡并覆盖边界(含反例、含模糊样本)。二是近因效应:示例的排序影响权重,最贴近当前输入的示例放最后效果最好;高级做法是按与输入的相似度动态检索示例(kNN few-shot),而不是写死。三是数量:3 到 5 个精选示例通常优于十几个堆砌,示例越多占窗口、噪声越大,还稀释指令的权重。可复制模板:任务:判断用户评论对{ {产品名}}的态度标签。 ​ 标签定义: - POSITIVE:明确赞扬产品本身 - NEGATIVE:明确批评产品本身 - NEUTRAL:只陈述事实或情绪指向不明(物流、客服问题若未牵连产品,归 NEUTRAL) ​ 示例: 评论:质量不错,第二次回购了 - POSITIVE 评论:包装破了个洞,东西还没拆 - NEUTRAL(批评物流,非产品) 评论:用了一周就坏了,差评 - NEGATIVE 评论:还行吧,跟描述差不多 - NEUTRAL ​ 评论:{ {user_comment}} -追问链:「示例和真实输入分布不一致会怎样?」- 模型会学示例的隐性偏差,比如示例全是短句,遇到长评论判断质量明显下降,所以要定期用线上 bad case 回补示例。「动态选示例的方案说一个?」- 把候选示例向量化,推理时按与输入的余弦相似度取 top-3 拼进模板,兼具相关性和多样性。「示例的数量上限怎么定?」- 以输出稳定为准,逐步加到指标不再涨为止,通常 3 到 8 个,超过 10 个收益趋零还挤占上下文预算。Q3
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻