摘要 | 2026-07 · Moli 是一个为 AI agent 设计的 headless browser;这里记录我在其中的角色与动机。

我在参与一个叫 Moli 的项目:一个为 AI agent 设计的 headless browser。传统浏览器是为人眼造的——渲染、合成、字体、GPU 占掉了大头开销,而一个 agent 真正要的,其实只是”读懂页面、点对按钮、拿到数据”。Moli 从头实现了一个轻量引擎,直接讲 CDP 协议,可以替换掉 Chrome、插进现有的 agent 框架里,用小得多的内存和启动成本跑完大部分自动化任务。这个方向已经有先行者(比如 Lightpanda),Moli 想成为在真实 agent 场景里更能打的那一个。

我在项目里的角色主要是两块。一是评测:为这个引擎设计并搭建一套系统化的 benchmark——从 CDP 协议兼容性、浏览器机制级测试,到真实 agent 任务和线上网站的分层靶场,持续回答”Moli 与 Lightpanda、Chrome 的能力边界各在哪里,产品什么时候该 fallback、代价是什么”。二是社区:对接用户反馈与宣发。前者是我的主要投入。

Motivation

决定接下它,先是因为它有实打实的价值:项目本身的回报,对我个人则是一份工程能力的证明——算法岗越来越看重一个 PhD 是否真的能把东西造出来,而不只是发 paper。

更吸引我的,是它像一个我很想亲自跑一遍的实验。我此前做的跟 browser 最相关的是 browser/GUI agent 的评测 benchmark,没有浏览器开发经验,甚至没怎么写过前端。恰恰是这个位置让问题变得有意思:在 AI 时代,一个没有领域背景的人,借助 AI 究竟能在多大程度上完成一个严肃的跨行工程项目,并真正建立起对这个领域的心智模型?顺带地,它也在检验我沟通、推进项目、解决”新问题”的能力。

再往下一层,是我对大型软件工程本身的好奇。近现代多数科技发明真正走进生活,靠的不是想法本身,而是把想法工程化的漫长过程——做到鲁棒、安全、可扩展、可自动化之后,技术才变成人人可用的基础设施(e.g. 互联网,飞机背后的飞控软件)。浏览器是最典型的例子之一:普通人每天用得最多、却最少意识到其复杂度的软件。哪怕只从评测这一侧切入去参与造一个浏览器,也是我能想到的、理解”工程如何让技术落地”最直接的方式。

Why I do

说到底,我做这些事的理由是一致的:我想弄清楚事物为什么 work,也想知道自己能把一个想法推进到多远。研究让我逼近前者,而像 Moli 这样的工程让我检验后者——能把一个东西真正造出来、让它在真实场景里站得住,对我而言和想清楚一个问题同样重要。当然,在一个充满技术感的团队去做一个 infra 上的”SOTA”,这从哪个角度看都 cool 极了