跳过正文

把上下文攥在自己手里

·3393 字·7 分钟
Rollin
作者
Rollin
机器人产品规划 × AI 全栈独立开发者,铁人三项爱好者。

这篇的初稿不是敲出来的。我按着 Apple Watch 说了十几分钟,说完自动转写成文本,Claude 把转写稿读完起草,我再逐段改。整条链路的每一段都在我自己的设备上,没有哪一段是在等某个平台开放给我。

会写这篇,是因为看完 iPhone 发布会之后,我想把这件事讲清楚。

苹果那条链路
#

去年做 AI 陪伴玩具和录音卡片的时候,团队里反复问的一个问题是:手机厂商要是自己做了,我们怎么活。

现在苹果把答案摆出来了一半。iPhone 是 Personal Hub,手表负责全天候采,端侧模型负责嚼,Siri 负责端出来。上下文从采集到消费,一步都不出这个生态。

Apple Watch 成了录音卡片最大的对手。不是因为它录得更好——它录得未必更好——是因为它录完之后那一段路是通的。

这里要停一下说清楚:厉害的不是任何一个单点能力。录音谁都能录,转写现在也不稀奇。难的是录完之后那段东西自动去了它该去的地方,并且在你需要的时候被端到你面前。闭环是这个意思。

所以我的第一反应不是「完了」。是这条链路我自己也跑通了一版,而且有一个地方可以不一样。

我这条链路长什么样
#

采集在 Apple Watch 和 iPhone 上。开会按一下手表就录,路上想到什么对着说两句。除了语音还有几路:截图 OCR、剪贴板、健康数据。到今天库里 650 条,健康 381 条、随手记 107 条、截图 71 条、录音 38 条,剩下的是被分好类的任务、问题和想法。

转写跑在家里那台 Mac Studio 上,不出门。FireRedASR 做识别、pyannote 分说话人,都跑在 Apple 的 GPU 上,一段 12 秒的中文大概 1.6 秒出结果,五倍速。中文识别比 Whisper 那条线准,代价是得自己养一台机器。

沉淀落进一个 Obsidian 库。这个库是唯一的数据源,云上不留副本。三年前我构想这件事的时候写的是「个人数据库在云端」,真动手做的时候架构掉了个头:我自己都不愿意把日记和会议录音传到别人的服务器上,那就只能反过来——数据在本地和我自己的 iCloud 里,云端只跑一个无状态的推理,算完就走,不留东西。这段前因后果我在给三年前的自己对账里写过。

取用是我自己写的一套 MCP。Claude 可以直接搜条目、读某一条的完整转写稿、把改好的纪要写回去、写日记。

这一段不需要我开口。库里进了新条目,检测到就能触发,Claude 自己把转写稿拉出来,该出纪要出纪要,该起草文章起草文章。这篇的初稿就是这么来的——我说完那十几分钟,剩下的事它自己走完了。

关键的是最后一段
#

前面三段,大厂都能做,而且做得比我好。采集有它们的硬件,转写有它们的端侧模型,存储有它们的云。

只有最后一段是另一件事:我的数据,能不能被我选的那个 AI 读到。

这一段不取决于能力,取决于谁握着接口。笔记软件不开放 MCP,我想用 Claude 去读它就得等。这个「等」字是问题所在——东西是我的,用不用得上却由别人决定。我自己写的那套,就没有这个等的环节,想怎么用怎么用。

区别不在能力,在屁股
#

现在做个人上下文的公司不少,采集能力之间的差别没有想象中大。差别在于收上来的东西拿去干什么。

多数是拿去训自己的模型、做自己的估值。用户交出了上下文,换回来一个更聪明的产品,但变聪明的那个过程和它带来的收益跟用户没关系,用户也带不走。这个屁股是歪的。

我想做的是另一件事:收上来,还回去。上下文归用户,用户想用哪个模型、哪个 Agent 去处理它,是用户自己的事。

这条线也是我白天工作的方向,只是尺度不同:白天想的是怎么让一类设备把上下文交还给它的使用者,晚上做的是把我自己这一份先收回来。

这不是道德姿态,是一个很实际的判断。上下文的价值是随时间复利的,攒三年才刚开始有用。而要让一个人愿意攒三年,前提是他相信这些东西不会被锁死在某家公司里,也不会因为对方改了条款或者关门就没了。做不到这一点,他就不会认真攒;不认真攒,后面那些复利也就不存在。

中立指什么
#

具体是三件事。

数据落在用户能指定的地方。 用户随时能整个搬走,搬走之后原来那套还得能用,不然「能搬」就是句话。

能力用协议暴露,而不是一个个去开放。 MCP 的思路是对的:设备或者服务向 Agent 声明自己有什么能力、边界在哪,剩下的交给 Agent 去编排。声明式的好处是,不需要平台预先想明白用户要拿它干什么。

场景不由平台定义。 这条最难。

MHS 把第二条写成了规范
#

上个月 Anthropic 发了一个叫 MHS 的东西——Model Hardware Standard,模型硬件标准,8月27日的研究预览。软件那层 MCP 已经做完了,这个是往物理设备那层接。

一个 MHS 驱动里要声明的不只是「能调用哪些操作」,还包括这台设备本身是什么:重量多少、可达范围多大、能测哪些物理量、哪些参数允许调、什么条件下禁止动作、哪些安全限制会被强制执行——而且这些可以直接用自然语言写进去。生成出来的东西,本质上是一份给 Agent 看的设备说明书。它是 model-agnostic 的,任何 agent harness 都能通过 MCP 这类标准协议接进来。

我看到的时候的感觉是:想的是同一件事。设备不该等着谁来适配它,它应该自己把「我是什么、我能干什么、我哪里不能碰」说清楚,剩下的交给 Agent 编排。

但它现在只开给科研实验室和先进制造企业,要申请。Anthropic 说之后会开源。中立不中立,就看这一步走不走得成——一个规范如果只有申请到的人能用,那它还是某个平台的接口,不是行业的协议。

为什么第三条最难
#

难在产品经理想不出垂直细分场景。我做了这些年产品,这点我认。

坐在会议室里能想出来的场景,是那种放之四海的场景,恰好也是用户最不需要专门买个东西来解决的场景。真正值钱的需求都长在具体的人身上,高度定制,而且当事人往往连怎么描述都描述不清楚。

所以这两年能看到一批厂商在换打法:成熟硬件把接口开出来,办黑客松,或者干脆开源,让开发者进来替自己想场景。这不是在做慈善,是在买场景——买那些自己想不出来的用法。哪个跑通了就把它工程化,从一个七八成能跑的 demo 做到九成九能跑,然后变成产品卖给更多人。

我看到有一家的比赛规则里写着,参赛的所有设计文档和代码归主办方所有。野心写得很清楚:我造通用的产品,你们进来造场景,场景归我,我卖产品,后面还要卖订阅。

这一步之差就是我说的中立。同样是开放接口,一种是把开发者和用户的产出收进自己口袋,另一种是让它留在产生它的人手里。前者能起量,但它请进来的开发者随时可能发现自己是在给别人打地基。

数据闭环这件事绕不过去
#

为什么自动驾驶跑得快,具身智能这边慢,说到底是同一个问题。

汽车那边有海量用户每天在真实路况里开车,数据自然沉淀,模型自然迭代,闭环是长在使用场景里的。人形机器人缺的就是这个:买回家之后,它在家里持续产生有用数据的那个场景还没立住,厂商只能自己雇人出去采。自采的数据又贵又窄,闭环转不起来。

这也是我不看好「为了拿上下文而造一个产品」的原因。顺序得是反的:用户真的有那个需求,天天用,上下文是用的过程中自然掉下来的。像开车一样。

我还没解决的
#

说完了想清楚的,说没想清楚的。

二十四小时录音做不到。 没有官方接口,我只能做到按一下录一段。这不是工程量问题,是这条路我走不通。

跨设备的上下文共享和持久化,隐私怎么保还没想清楚。 现在能做到「不出我自己的设备」,是因为设备就那么几台而且都是我的。要是想让这套东西对别人也成立,这一层得重做。

最根本的那条不在工具上。 链路跑通之后我才发现,卡住的不是自动化程度,也不是模型够不够强——这两样现在都够用了。卡住的是知道自己想要什么。

工具已经到了这个地步:你能说清楚要什么,它大概率能给你做出来。反过来,说不清楚的时候,再强的模型也只是替你把一件你自己没想明白的事做得更快一点。我见过不少人拿到工具的第一反应是学工具,学完了还是不知道拿它干嘛,然后去学下一个工具。

所以「把上下文还给用户」这件事,前提是用户接得住。大部分人现在接不住,缺的不是教程。这个缺口怎么填我没有答案,只知道答案不是「教用户写 prompt」。

AI 给的是自由
#

写到这儿我想说的其实不是效率。效率是顺带的。

三年前我想把自己经历过的东西沉淀下来,当时只能写在笔记里,然后等——等有人做出那个工具,等某个平台愿意把接口开给我。现在我说一句话,它自己走完转写、归档、起草这一整条路,中间没有一个环节是我求来的。

这才是 AI 真正给的东西:实现自己想法的自由。 想要一个东西,就能把它做出来,不用等谁点头。门槛从「你会不会做」挪到了「你知不知道自己要什么」——后面这道门槛更高,但它至少在你自己身上。

把上下文攥在自己手里,是同一件事的另一面。不是为了防谁,是不想再等。

碎碎念在这里,iOS 和 macOS 两端。它现在的样子就是这篇文章里描述的那条链路,我自己每天在用。