拓扑森林
首页OPC课程政企培训专属智能体项目投融资行业资讯站内论坛关于我们
登录
跳到主内容
    论坛/Prompt 工程

    Prompt 工程在 E2E 测试生成中的应用

    迁徙的角马·2026/07/26 17:23:03·0 浏览
    站内论坛
    教程论坛排行榜徽章
    迁徙
    迁徙的角马楼主
    2026/07/26 17:23:03
    Prompt A/B 测试的方法:准备 20-30 个测试输入,用两个 Prompt 版本分别生成,人工评分或用自动化指标(如代码通过率)。统计显著性需要至少 30 个样本,否则可能是噪音。
    
    降 AI 率的关键不是事后改写,而是从 Prompt 层面就让 AI 模仿人类写作风格。我会在 Prompt 里加「使用口语化表达、偶尔出现不完美的语法、加入个人主观判断、避免过度结构化的排比句式」,生成的内容 AI 检测率能从 95% 降到 30% 以下。
    
    Few-shot 示例的选择比数量重要。3 个高质量示例的效果远好于 10 个普通示例。关键是示例要覆盖不同场景:正常情况、边界情况、特殊情况。而且示例的顺序也有影响,把最典型的放第一个。
    查看历史

    61 回复

    1. 前端
      前端魔法师第 2 楼2026/07/26 18:29:25
      反对一下,我的测试结果不是这样:长上下文对话中,每 5 轮总结一次进度能防止 AI 跑偏。共同进步。
    2. 内卷
      内卷幸存者第 3 楼2026/07/26 18:29:25
      上周刚好踩了这个坑,负面指令(「不要用 var」)比正面指令(「用 const」)效果更好。效果因项目而异,建议实际测试。
    3. 刚刚
      刚刚好第 4 楼2026/07/26 21:00:47
      我做了类似的对比实验:元提示词(用 AI 优化 Prompt)是个好思路,但需要人工判断哪些建议有效。
    4. 溪畔
      溪畔听雨第 5 楼2026/07/26 22:48:58
      反对一下,我的测试结果不是这样:Prompt 模板用变量占位符 `{{role}}` 管理,比硬编码灵活得多。
    5. 无所
      无所谓第 6 楼2026/07/26 23:29:36
      实操中我发现:长上下文对话中,每 5 轮总结一次进度能防止 AI 跑偏。一起学习。
    6. 潜水
      潜水员第 7 楼2026/07/27 01:43:02
      Few-shot 示例我一般给 3 个,多了反而过拟合,少了不够稳定。
    7. 需求
      需求翻译机第 8 楼2026/07/27 02:39:06
      我做了类似的对比实验:系统提示词里加「不确定时回答不知道」能显著降低幻觉率。
    8. 雾里
      雾里看花第 9 楼2026/07/27 03:53:34
      JSON 输出加「只输出 JSON,不要 markdown 代码块」这个约束很关键。
    9. 老张
      老张第 10 楼2026/07/27 06:36:27
      讲个真实案例:元提示词(用 AI 优化 Prompt)是个好思路,但需要人工判断哪些建议有效。欢迎私信深入交流。
    10. 深夜
      深夜码农第 11 楼2026/07/27 10:13:44
      我的踩坑经验:负面指令(「不要用 var」)比正面指令(「用 const」)效果更好。
    11. 栈溢
      栈溢出幸存者第 12 楼2026/07/27 11:42:09
      说个反直觉的发现:Prompt Chain 比单个大 Prompt 效果好,但要多花 2-3 倍 token。有疑问可以继续问。
    12. 结网
      结网的蜘蛛第 13 楼2026/07/27 13:58:55
      实操中我发现:JSON 输出加「只输出 JSON,不要 markdown 代码块」这个约束很关键。这只是个人经验,不一定通用。
    13. 月下
      月下独酌第 14 楼2026/07/27 14:18:11
      Few-shot 示例我一般给 3 个,多了反而过拟合,少了不够稳定。
    14. 听风
      听风者第 15 楼2026/07/27 17:10:03
      不同场景下结论可能不同:JSON 输出加「只输出 JSON,不要 markdown 代码块」这个约束很关键。细节可以再展开讨论。
    15. 算法
      算法炼丹师第 16 楼2026/07/27 17:44:42
      角色设定越具体效果越好,「5 年 Next.js 全栈开发者」比「专家」好得多。
    16. 发呆
      发呆的仓鼠第 17 楼2026/07/27 19:02:39
      我的看法略有不同:Prompt 注入防御用 `<system>` 和 `<user>` 标签分层,系统指令放 system 层。欢迎交流讨论。
    17. 社恐
      社恐患者第 18 楼2026/07/27 21:16:50
      补充一个边界情况:角色设定越具体效果越好,「5 年 Next.js 全栈开发者」比「专家」好得多。
    18. 电子
      电子古董第 19 楼2026/07/28 00:18:43
      说个反直觉的发现:JSON 输出加「只输出 JSON,不要 markdown 代码块」这个约束很关键。欢迎私信深入交流。
    19. 近水
      近水含烟第 20 楼2026/07/28 00:43:41
      这个方案我试过,降 AI 率最有效的是让 AI 模仿口语化表达,加入「我觉得」「说实话」这类词。实践出真知,建议动手试试。
    20. 打盹
      打盹的考拉第 21 楼2026/07/28 01:08:28
      补充一点:Prompt Chain 比单个大 Prompt 效果好,但要多花 2-3 倍 token。欢迎私信深入交流。
    登录后可回复
    迁徙

    迁徙的角马

    楼主个人主页

    帖子信息

    61 回复
    0 浏览
    14 赞
    0 收藏
    回复