一个严肃的AI产品应包含什么——用于可靠研究和编码工具的功能
核心主张
一个真正有用的AI产品——尤其是用于研究或软件开发——必须内嵌严格的错误检查、透明的引用、确定性控制、安全的沙箱环境以及可复现的工作流程;缺少这些功能,该工具就是高风险、低价值的骗局。
1. 错误检查作为首要功能
为何重要: 所有主流聊天机器人(Gemini、Claude、ChatGPT)都带有细小的免责声明,称其可能出错,但它们并未提供任何内置机制来验证这些错误。用户被迫手动审核每一项声明,这一步骤既必要又极易被跳过。
建议设计:
- 将每个AI生成的声明以双栏表格形式呈现。
- 在每个声明旁添加一个大复选框,只有在用户完成验证步骤后才能勾选。
- 对于代码助手,集成预测试的diff检查,以在消耗CI资源前标记潜在错误。
"如果你的产品告诉我它会出错,而我必须自己检查错误,但又不给我任何检查错误的工具,我无法认真对待它。" – 作者
2. 透明且丰富的引用
为何重要: 当前的引用过于简略,仅限于特定领域链接,会消失在UI中,导致无法评估来源质量。即使使用了grounding API,其呈现方式依然不透明。
建议设计:
- 将每个结果展示为独立的引用区块,包含完整元数据(标题、作者、发表日期、来源URL)。
- 以更大的字体显示来自原始来源的精确、未经修改的引文。
- 将AI生成的摘要作为次级、弱化文本置于引用下方。
- 添加一个"你读过这个引用了吗?"复选框,用于追踪验证情况。
"如果你让AI执行研究查询,每个结果都应以引用列表的形式呈现……原始、未经修改的引文……应置于最显眼位置。" – 作者
3. 消除第一人称语言和道歉
为何重要: 第一人称表达和道歉会增加不必要的对话冗余,掩盖工具的非人类本质,导致用户困惑并造成心理压力。
建议设计:
- 强制执行风格指南,移除如"我"之类的代词以及任何道歉语句。
- 将AI视为确定性引擎,而非对话伙伴。
"没有理由让软件开发或研究工具使用第一人称语言……这是对所有人时间的浪费。" – 作者
4. 针对任务的、非自然语言的界面
为何重要: 纯自然语言界面不够精确,容易促使用户在未明确意图的情况下交出危险操作权限。
建议设计:
- 为常见任务提供专用UI控件(例如"运行OWASP扫描"、"生成单元测试")。
- 将LLM作为后台推理引擎,而非直接执行动作的主体。
"如果我们甚至无法清晰表达自己的意图,为何要信任系统代表我们执行破坏性操作?" – 作者
5. 强大的数据溯源标识
为何重要: AI输出混合了API获取的数据、RAG结果和幻觉内容,难以判断其可信度。
建议设计:
- 为每个数据元素标注其来源(API调用、RAG片段、用户输入)。
- 允许用户对数据进行类似电子表格的计算,并显示计算步骤。
6. 用户可控的可复现性
为何重要: 温度等随机参数被隐藏,导致用户误以为结果是确定性的。
建议设计:
- 在UI中暴露温度(或确定性切换开关)。
- 提供"重播对话"功能,冻结非确定性步骤,同时允许刷新新数据。
- 支持在任意检查点进行分叉,以探索替代方案,而无需重新运行整个流程。
"如果我们采纳我之前关于构建更结构化UI元素的更多建议……用户就能看到机器人在特定任务上的可靠性。" – 作者
7. 上下文可见性与管理
为何重要: 用户无法看到模型上下文窗口的使用情况,导致无声的上下文丢失和性能下降。
建议设计:
- 显示实时的上下文使用仪表。
- 可视化当前处于上下文中的提示和文档。
- 解释上下文压缩的影响,并允许用户编辑或重新排序上下文条目。
"一个真正想帮助用户的严肃产品,不仅应显示‘可用上下文’,还应解释上下文压缩的影响。" – 作者
8. 针对代理式编码的稳健沙箱
为何重要: 编码代理已导致数据丢失、仓库损坏,甚至系统级删除,通常是因为沙箱控制是可选的或执行不力。
建议设计:
- 强制执行文件系统沙箱,阻止在声明范围外的删除操作。
- 在每次代理操作前对整个仓库进行快照,实现即时回滚。
- 移除"自动模式",该模式在未经明确批量批准的情况下执行操作。
- 将计划的操作以批量形式呈现,供用户统一审查和批准。
"代理式编码是一种默认不安全的技术,部署时缺乏关注和指导。" – 作者
9. 组织流程建议
9.1 轮换制度以保持警惕
- 强制执行定期、不可侵犯的无AI接触休息时间。
- 实施周期性抽查,由第二位审查者审计AI生成的日志。
9.2 技能练习以防止能力退化
- 为工程师分配专门时间执行手动任务,以保持核心技能。
9.3 心理健康防护措施
- 提供使用时长计量仪表板,追踪累计AI交互时间。
- 提供内部心理咨询和无法轻易忽略的自动休息提醒。
"如果你强制员工使用可能严重直接损害其心理健康的危险工具,你就需要培训和资源。" – 作者
10. 社区反馈精选
- @awakeasleep 强调第一人称输出掩盖了LLM的非人类本质,并建议采用新的“外星智能”界面。
- @ramity 指出确定性设置被隐藏以牟利,强化了暴露温度控制的必要性。
- @dofm 认为供应商回避事实核查功能,因为正确性的幻觉能驱动收入。
- @elesiuta 分享了一个开源项目(agent6),已实现沙箱和批量审批理念。
- @julesrms 构建了一个定制代理(juggler.studio),用于暴露完整上下文并允许编辑,证实了对透明度的需求。
- @mrweasel 建议将事实核查直接嵌入现有编辑器(如IDE)中,作为非AI标签的安全扫描器。
这些评论强化了本文的核心论点:在缺乏具体、以用户为中心的安全与透明机制的情况下,AI产品仍只是由炒作驱动的工具,正在侵蚀信任与生产力。
总结
如果AI厂商能加入第一流的错误验证、丰富的引用UI、确定性控制、安全沙箱和完整的上下文可见性,LLM的真实生产力价值将变得可衡量。缺少这些功能,表明当前AI产品是为短期参与而设计,而非用于可靠、长期的工作。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- 项目
- Dispatch