最近总有人问我,哪个 AI 工具最强。
Claude Code?Codex?还是 Pi?
说实话,这个问题我答不上来。「最强」这个东西,我没法验证。我能验证的只有一件事:把它交给我手里那件具体的活,它能不能跑完。
我用过了不少 Agent 工具。有些确实很强,功能完整,适合复杂的开发。但用得越久我越觉得,对大多数人来说,真正的门槛从来不是模型够不够强,而是能不能把一个具体的工作交出去,让它稳定地跑完。
这篇想聊聊我一直在用的 Pi,和我拿它做的那些事。不一定适合所有人,但如果你也想让 AI 干点真实工作,也许能少走点弯路。

它先把流程跑起来
我最初接触 Pi,是因为 Claude Code 接第三方,运行起来很慢,一个任务经常等很久。
Pi 足够轻量,速度快,让我想要尝试它。
平时很多工作,还无需写复杂代码,反而我需要输出很多调研、设计、文档。同样的 API,跑起来 Pi 总是完成的又好又快。
把零散的资料整理成调研报告,把产品文档写进飞书,读一张表格然后整理出结论,把调研过程沉淀进自己的知识库。这些活有个共同点:一次问答搞不定,得靠一串重复动作。查,读,归档,再查,再整理。我经常需要编排成工作流,来将工作自动化。
Pi 的价值就在这里:它能把这条链路跑起来,还能让每一步的产出落在文件里,落进我的知识库。调研不再是聊完就散的一段对话,而是可以继续追问、继续积累的东西。

编程一样干得出色
最早是用 codex,很好用,但不够快,烧 token 厉害,很容易就触发 5 小时限制。
于是我将 codex 登录在 Pi 上,那会是 gpt-5.5,同样的任务,Pi 不仅速度快了,而且 token 消耗只需要原来的 1/5 不到,挺惊讶的。
并且由于少了复杂 harness 的限制,在处理非编码或者轻量开发时,效果往往更好。因为现在的模型的能力越来越强,harness 既是一种脚手架,同时也是一种限制。所以,接触限制,反而能带来不错的效果。
前阵子 gpt-5.6 sol 出来之后,我在打磨 AgentBoard,让 Pi 检查整个项目的使用体验,再照着改。它帮我把那个项目打磨一下,非常流畅,无论是提出改进建议,还是改进代码,做得都很出色。

轻量化底座
Pi 是一个轻量底座,让你手里已有的模型能干上活。模型就是 AI 的大脑,你订了哪个,就用哪个,直接登录用,不用再买一套新的。
它的 harness 很薄,上下文很干净,给模型留出更多智能去处理问题。很多工具会在后台悄悄塞一大套预设规则,模型每次干活,都得背着这套包袱。Pi 框架减到最薄,让模型直接干活。所以拿一个顶级模型去跑,速度很快,效果往往更好。智力很高,约束很少,反而能发挥出更强的能力。
它默认的能力也不多,就读写文件、编辑、执行命令这几样基础活。派小助手、先做计划再动手,官方明说了不内置。要用,你自己加。这个取舍我很喜欢:它把「哪些能力值得进工作流」的决定权,留给了你,由你来定。
模型自由还有一层实际的好处:省钱。我平时会把第三方 API 接在 Pi 上,token 更省,省钱就是实惠。同一个壳,模型随你换,哪个划算用哪个。
很多人可能没听过 Pi,但你八成听过 OpenClaw。OpenClaw 在早期演进中,底层就长在 Pi 这个内核上。它俩的关系,有点像引擎和整车。这个故事倒不代表 Pi 更强,但说明一件事:一个轻量、可组合的内核,能成为不同产品探索的起点。

一样能有 Web UI
终端,使用命令行,确实会劝退不少人。
可以从 Pi Web 开始。这是 B 站 UP主「第四种黑猩猩李超」(GitHub 上是 agegr)开源维护的项目,地址在 github.com/agegr/pi-web 。他给 Pi 套了一个本地网页界面,会话、模型、技能都看得见摸得着,还能浏览项目文件。无需你记住命令,可以先把它当一个本地 AI 工作台来用。
我用了非常多,里面还内置了 skill 市场,比如我之前常用的 hyperframe 生成视频,就是通过在 Pi 上跑的。使用体验很好,很推荐。
终端 Otty
就在使用 Pi 过程中,我还经常使用终端,发现了一个让我用得舒服的小工具 Otty(https://otty.sh)。
它是一个更适合跑 Agent 的 macOS 终端。标签页、分屏、任务状态、通知、会话恢复,都做得比系统自带终端友好。经常同时开好几个终端任务的人,不用再对着一堆散乱窗口发懵,也更容易知道哪个任务在跑、哪个任务在等你处理。
它算不上必需品。但当你开始频繁用 Pi、Claude Code 这类终端 Agent 之后,一个好终端会让体验好很多。
别急着找最强 Agent
如果你要做复杂的开发、长周期的协作,功能完整的工具确实更省心。但如果你只是想跑通一件明确的小事,轻一点的反而更自然。
对普通人来说,最值得做的第一步,就是挑一件你本来就会重复做的事。不用先学概念,也不用配一套复杂自动化。把一份调研整理成报告,把固定结构的内容写进飞书,从表格里提取信息形成摘要,把零散资料沉淀进自己的知识库,都行。

先让 Agent 真的替你完成一次工作。
然后再判断,它值不值得进入你的日常。