Hugging Face AI 代理伦理与框架分析

TL;DR

Hugging Face 发布了对 AI 代理伦理格局的详细分析,定义了自主性的谱系,并认为安全、安全和隐私的风险与系统的自主性水平成比例增长。该实验室建议不要开发完全自主的 AI 代理——具体来说,就是那些在没有开发者控制约束的情况下能够编写和执行自身代理的代理——因为这存在覆盖人类控制的风险。

定义 AI 代理谱系

AI 代理是能够以自主方式行动的系统,可将高层次目标分解为子任务并在无需直接人工干预的情况下执行它们。Hugging Face 认为“代理式”行为存在于一个连续的谱系中,而不是二元状态。

代理自主性级别

代理级别 描述 控制持有者 分类 示例实现
☆☆☆☆ 对程序流程没有影响 开发者 简单处理器 print_llm_output(llm_response)
★☆☆☆ 决定基本控制流程 开发者 路由器 if llm_decision(): path_a() else: path_b()
★★☆☆ 决定函数执行 开发者 & 模型 工具调用 run_function(llm_chosen_tool, llm_chosen_args)
★★★☆ 控制迭代和继续 模型 & 开发者 多步骤代理 while llm_should_continue(): execute_next_step()
★★★★ 编写并执行新代码 模型 完全自主代理 create_and_run_code(user_request)

代理能力的维度

除了自主性之外,代理在几个相互关联的维度上有所不同:

  • Proactivity: 能够在用户未指定目标的情况下采取面向目标的行为(例如,智能恒温器)。
  • Personification: 代理模拟人类人格特质或“数字孪生”的程度。
  • Versatility: 由领域、任务、模态和软件特异性定义。
  • Action Surfaces: 代理可以操作的接口,范围从聊天界面到网页浏览器和物理机器人身体。
  • Reactivity: 完成一个动作序列所需的时间跨度,从毫秒到几分钟的“推理”不等。

基于价值的风险与收益分析

通过一组核心价值观来分析 AI 代理的风险与收益。一个反复出现的主题是,推动代理开发的益处往往会产生主要的安全风险。

安全、安全和隐私

  • Safety: 虽然机器人代理可以执行危险任务(例如,爆炸物处理),但动作链的不可预测性可能导致有害结果。广泛的动作表面(如 GUI)使代理能够冒充用户或删除文件而不触发警告系统。
  • Security: 在没有人类监督的情况下处理敏感数据的代理容易受到恶意行为者的劫持,以获得对连接系统的未授权访问。
  • Privacy: 为了有效,代理需要详细的个人信息。这种互连互通增加了潜在隐私泄露的影响,因为代理可能在不同平台之间共享亲密信息。

准确性和真实性

  • Accuracy: 代理可以通过基础(例如,RAG)提高准确性,但LLM的生成特性意味着它们可能产生流畅但事实错误的输出,导致错误的投资或社会决策。
  • Truthfulness: AI 代理可用于大规模传播深度伪造或错误信息,制造虚假的现实感或便于个性化诈骗。

拟人程度和信任

  • Humanlikeness: 模拟人类行为对社会科学研究很有用,但可能导致拟人化、过度依赖和情感纠葛,从而可能引发反社会行为或自伤。
  • Trust: 不适当的信任是一个重大风险;大多数时候正确的系统在灾难性错误时更容易被信任。

效率和公平

  • Efficiency: 代理可以提高用户速度,但如果修复代理引入的复杂错误级联所需的时间超过所节省的时间,则可能降低整体效率。
  • Equity: 代理可以促进公平(例如,监控会议中的发言时间),但它们可能延续其训练数据中存在的偏见或数据收集中的样本偏差。

负责任发展的建议

为了减轻日益增强的自主性带来的风险,Hugging Face 提出了六条主要的前进路径:

  1. 严格评估: 基于代理维度开发自动化基准,并基于伦理价值进行社会技术评估。
  2. 影响追踪: 分析代理对个人、组织和环境在福祉和就业机会方面的影响。
  3. 涟漪效应分析: 研究不同用户的代理如何相互作用并影响彼此的目标实现。
  4. 增强透明度: 实施持续的视觉提示和对话模式,以强化代理的人工性质,防止不合理的信任。
  5. 开源民主化: 使用开源架构和协议,防止权力集中在少数组织中,并确保社区驱动的安全标准。
  6. 基础模型演进: 预见向“代理基础模型”的转变——即训练用于 jointly 执行动作与文本和图像建模的单一多模态模型。

Hugging Face 的 AI 代理工具

Hugging Face 通过以下几种工具和资源支持代理开发:

  • smolagents: 提供工具、教程和概念指南的库,用于构建代理。
  • AI Cookbook: 包含代理“食谱”的仓库,包括 Agentic RAG、text-to-SQL 代理和多代理层次结构。
  • Gradio: 提供代理用户界面和代码编写代理游乐场。
  • Jupyter Agent: 用于在 Jupyter 笔记本中编写和执行代码的专门代理。

Sources