Deltix: AI-Driven Mobile App UX Testing

Deltix 是一个 AI 驱动的 UX 测试平台,它允许开发者通过使用纯英文描述所需的用户操作来测试移动应用流程。该工具使用 AI agent 在本地模拟器上自主导航移动应用,从而确定真实用户是否能够成功完成特定任务。

Local-First Privacy and Architecture

Deltix 使用连接到 iOS Simulator 的本地 Mac Agent 进行操作。这种架构确保了应用程序源代码、构建版本和签名身份保留在开发者的本地机器上,从而防止外部访问专有代码。

Agent 会观察屏幕并像用户一样与应用进行交互。虽然截图和运行记录存储在用户的账户中以便进行审查和回放,但用户可以选择通过自己的模型密钥来路由推理流量,从而对数据和成本保持进一步的控制。

Core Testing Capabilities

Deltix 为移动应用测试提供三种主要的交互模式:

Ad-hoc Testing

开发者可以编写一个任务——例如“sign up and send your first message”—并观察 agent 尝试完成它。这允许对新流程进行快速验证,而无需安排用户研究会议。如果 agent 失败,它会提供卡住位置的截图。

Playbooks

成功的运行可以保存为“Playbooks”。这些是成功任务的确定性回放,可以通过仪表板触发,以确保新构建版本不会引入回归(破坏现有功能)。

Experimentation

Experiment 模式允许开发者并排比较应用的两个不同构建版本。通过对两个构建版本运行相同的任务,团队可以在进入生产环境的 A/B 测试之前,确定哪种设计对用户完成任务更有效。

Development Roadmap

Deltix 目前正在针对 Mac 上的 iOS simulators 进行公开测试。以下功能计划在未来的版本中推出:

  • Physical Devices: Support for running tasks on real iPhones attached to a Mac.
  • Android Support: Expansion of the agent to work with Android emulators.
  • Android Emulator: Support for Android emulators.
  • CI/CD Integration: A CLI for replaying Playbooks via GitHub Actions, GitLab, or CircleCI.
  • Hybrid App Support: Native treatment for React Native and Flutter applications.

Community Perspectives on AI Testing

开发者之间的讨论表明,QA 领域正呈现出向自主 AI agent 的增长趋势。一些用户指出,可以使用现有的 LLM 能力(例如 Claude 的最新版本或为 AI agent 提供直接的 ADB access 到测试手机)来拼凑出类似的工作流。

一位开发者分享了一个使用 Claude Desktop 和 MCP servers 来将 Azure DevOps user stories 与 Playwright 集成的极度自动化的工作流,并指出虽然实现完全自动化的技术能力是存在的,但组织障碍——例如基于按人头计费的外包合同——往往会阻碍这些工具的全面实施。

Sources

相关

  • Dispatch
  • Dispatch
  • 项目
  • 项目
  • Dispatch