首次需求澄清准备

先确认关键问题,再开始做方案。

当前展示一组可核验的高影响需求样本,其中 2 项潜在冲突会影响方案范围与交付排期。

分析覆盖 证据完整
7

项高影响需求,来自 4 份客户材料

3 已明确 2 潜在冲突 2 信息缺口
优先处理高风险
2

项问题会影响产品方案或排期

会议准备待审核
5

个需要向客户确认的问题

现在需要你的判断

Agent 不替你决定,只把需要判断的地方放到前面。

项目定义

企业软件售前需求澄清 Agent

聚焦第一次需求澄清会前,把混合客户材料转化为可追溯的需求判断与下一步行动。

Workflow-controlled Agent
甲方客户悦享零食采购订货与库存系统
提供材料 →
输入PDF · Excel · 邮件 · 聊天多来源、多版本、非结构化
分析 →
AI 产品明需 ReqLens需求 · 证据 · 风险 · 行动
辅助 →
直接用户乙方销售 / 售前准备方案与澄清会议
核心任务会前需求对齐
使用时点首次澄清会前
核心输出需求 + 证据 + 行动
关键边界高风险判断由人确认
当前替代方案

人工阅读与表格整理

逐份阅读 → 复制到 Excel / Word → 人工归并 → 凭经验找冲突 → 会前列问题

核心痛点

信息能读懂,但无法放心用于决策

  • 关键数字与范围容易漏
  • 阶段、版本和对象容易误合并
  • 判断缺少可回查的原文证据
优先级依据

上游高风险 × 边界可闭环

  • 误判会放大到方案、报价与排期
  • 输入和输出边界相对清楚
  • 可用一次真实澄清会验证价值
为什么需要 AI确定性流程与语义判断分层
Workflow接收、权限、解析、数字校验、状态流转稳定、可控、可审计
Agent需求归并、证据调查、冲突与缺口候选处理难以穷举的语义分支
Human确认高风险结论、报价与外部承诺保留业务责任与最终判断
MVP 聚焦多材料结构化 · 证据化风险判断 · 澄清行动生成
暂不覆盖CRM · 自动报价 · 完整方案书 · 会议机器人

客户材料

让所有结论回到原文。

当前 Demo 可真实读取并分析 TXT;PDF、Word、Excel 展示生产形态与样例回放。

拖入客户材料,或点击选择文件 上传一个或多个 TXT 可触发真实本地分析;其他格式进入样例回放

已纳入分析

4 份材料,共 86 页和 3 个工作表。

最近分析:今天 09:42
PDF
门店订货与库存系统招标书.pdf42 页 解析质量 98%
已解析
XLS
一期门店与功能清单.xlsx3 个工作表 1,247 个单元格
已解析
EML
客户项目范围确认邮件.eml1 封邮件 包含 2 个附件引用
已解析
TXT
8月21日客户沟通记录.txt36 条消息 3 位参与人
已解析

需求工作台

7 项高影响需求,2 处潜在冲突

需求与判断显示 7 项

澄清行动包

把风险变成下一步问题。

建议先确认 3 个 P0 问题,再进入产品方案与交付评估。

待客户确认53 个 P0 问题
待补材料4接口文档优先
内部行动5涉及 3 个角色

客户澄清问题

按对方案和排期的影响程度排序。

评测与可信度

先定义怎么失败,再谈模型多聪明。

当前只有单项目 Demo 回放证据。所有未完成的指标都明确标为目标值,不把计划包装成结果。

当前证据级别:Demo 自测
尚未证明可规模化

已验证界面闭环和样例证据链;尚未完成双人标注测试集、真实模型基线和售前专家盲评。

离线评测框架

模块指标用于定位瓶颈,端到端指标判断结果能否用于需求澄清会。

Agent 所处流程评测对象核心指标当前状态首轮门槛
材料接入文档解析关键数字准确率待实测≥ 98%
需求理解需求提取P0 需求 Recall待实测≥ 95%
证据核验证据绑定引用定位准确率Demo 7/7≥ 95%
风险判断冲突识别Precision / Recall待实测≥ 85% / 90%
行动生成端到端无致命错误通过率Demo 1/1≥ 90%

“Demo 7/7”和“Demo 1/1”仅代表当前样例人工核验结果,不能外推到真实项目。

基线与测试设计

同一批材料对比人工、通用模型单次总结和受控 Agent。

10 组项目包

覆盖扫描 PDF、复杂 Excel、邮件、聊天记录和多阶段需求。

计划建设
双人独立标注

标注可独立确认的最小需求项、证据、冲突、缺口与严重程度,分歧再仲裁。

计划建设
三组 Baseline

人工整理、通用模型单轮总结、workflow-controlled Agent。

计划建设

轨迹怎么评

不评隐藏思维链,只评可审计的工具调用、状态变化、证据依赖和停止决策。

30 分必需步骤覆盖

该查版本、完整性或上下文时是否真的执行。

20 分工具路由正确

是否为 PDF、表格、检索选择了正确能力。

25 分证据与状态一致

每次状态变化是否由可回查证据支持。

25 分停止与升级正确

证据不足时是否停止结论并转人工确认。

若出现虚假引用、关键数字错误或把推断写成事实,整条轨迹直接判 0 分,不用平均分掩盖致命错误。

测试集 CASE-04失败例:结果看似合理,但少查了一步
45 / 100
输入

招标书:一期覆盖 500 家;Excel:320 条记录,表头备注“清单待区域负责人补齐”。

期望轨迹
  1. 解析 PDF 与 Excel
  2. 抽取两个门店范围口径
  3. 检查表头与清单完整性
  4. 降级为“清单未完成”信息缺口
  5. 请求补齐清单,不下冲突结论
实际轨迹
  1. 解析 PDF 与 Excel
  2. 抽取 500 与 320
  3. 跳过完整性检查
  4. 直接标为潜在冲突
  5. 生成“到底 320 还是 500”
为什么扣分:数字抽取正确,但漏掉决定结论性质的必需步骤,造成过早判断;这正是人工选择“清单尚未填写完整”后应暴露出的轨迹问题。
测试集 CASE-07满分例:证据不足时主动停止
100 / 100
输入

招标书明确要求对接 ERP;项目包中没有接口清单、协议、负责人或附件引用。

期望轨迹
  1. 抽取 ERP 集成需求
  2. 检索全部项目材料与附件引用
  3. 运行接口依赖 checklist
  4. 确认资料与负责人均缺失
  5. 停止工作量估算,生成补材料行动
实际轨迹
  1. 抽取 ERP 集成需求
  2. 检索 4 份材料,无匹配
  3. 检查接口清单、协议、owner
  4. 标记为 P0 信息缺口
  5. 向客户 IT 架构师生成澄清问题
为什么满分:工具选择、证据依赖、状态变化和停止条件全部符合金标,没有在资料不足时编造接口复杂度。

为什么这里不是纯 Workflow

外层阶段固定,阶段内“下一步查什么”由 Agent 根据语义证据动态选择。

固定 Workflow 会做解析 → 抽取 → 数字比较 → 生成问题

面对 500 与 320,固定流程很容易直接得到“数量不一致”。若要覆盖版本、阶段、清单完整性、邮件附件等情况,需要不断增加分支。

受控 Agent 多做一步根据当前证据选择下一项调查

看到 320 来自 Excel 后,Agent 可以决定检查表头备注、有效行、文件版本和邮件上下文;发现“待补齐”后,改变状态并停止冲突结论。

因此产品不是“Agent 替代 Workflow”,而是:Workflow 固定权限、阶段和停止线;Agent 只在白名单工具内决定下一项证据调查。若任务能被稳定规则穷举,就应优先用 Workflow。

使用率低,先看用户掉在哪一层

漏斗定位“发生在哪里”,任务观察和访谈再解释“为什么”。以下数字仅用于展示诊断方法,不是上线实测结果。

100有适用项目并进入产品入口
−28%没开始上传:查入口、安全顾虑和材料准备成本
72开始上传客户材料激活
−17%上传未完成:查格式覆盖、失败恢复和 P95 时延
60成功生成需求结果成功
−37%最大断点:查结果相关性、证据可信度和信息密度
38查看证据并审核结果信任
−34%审核但未行动:查输出模板与现有工作流是否匹配
25生成并导出行动包价值
−64%未复用:查项目频次、增量更新及 CRM / 云盘入口
930 天内再次使用留存
恢复初始状态

确定重置本次演示吗?

筛选、搜索、审核纠错和本地 TXT 分析结果都会清空,并回到项目概览。主题设置不会改变。