我两套服役中的NAS硬盘有200TB(如图)
但AI Agent却没法记录我点外卖的口味,喜欢吃啥。
今天我想把大众点评收藏餐厅列表导出,
给我的Agent让它了解我的美食记忆上下文,
我点“个人信息下载”-填写邮箱,像X的导出似的,
它也郑重其事地给我发了一个邮件,带了个TXT附件,
打开一看,好家伙,就是份几十个字的个人资料。
想导出外卖订单记录,更是无果。
可这些数据明明是我自己的不是吗?
我在屏幕上可以看,却不让我导出。
巧妇难为无米之炊。
当今Agent的记忆,全靠用户花费时间精力注意力,
主动去喂,无论是打字、说话、传数据,都是如此,
即使是国际互联网生态的个人上下文走MCP/API流动,
对普通人来说也是处处壁垒门槛和麻烦。
人的注意力,就是Agent记忆上下文的最大瓶颈,
而个人上下文记忆,就是Agent用例的最大瓶颈。
也许你在想,如果穿戴式摄像头发展到位,
就能实现“自动无感输入上下文”了,
比如智能眼镜,挂脖子的项链记录仪,
甚至带摄像头的耳机“VisionPods”
等等形态。
但这些都还需时日,且物理世界的视觉
信息密度低,隐私阻力大,识别复杂度高等等。
当代人大部分信息都在手机/电脑屏幕上了,
所以最快可行的视觉记忆“自动记录仪”形态,
就是Plaud AI这种吸在手机背面的录音卡片,
加上USB-C连接,就能24小时录屏手机画面
(原理同XReal智能眼镜投屏),
比磁吸充电宝轻巧得多;
或者电脑HDMI口插上视频采集盒,
并配套从录屏解析导出结构化上下文的软件。
那么无论你在手机/电脑上做什么,
点外卖网购、打游戏看剧、聊天、刷推、工作...
录屏卡片都能以视频数据的形式,
记录下来,同时作为上下文喂给Agent。
C端个人AI时代下,
API/MCP/CLI...
是理想主义者眼中的结构化世界入口,
而屏幕视频流才是混沌APP世界的现实入口,
让我的个人数据真正能为我所用。
就像Elon Musk用坚持第一性原理,
坚持用视觉模型做真正的自动驾驶,
而不是指望“精确的激光雷达”,
也不是指望全球道路来兼容自动驾驶。
豆包手机团队与其做掀桌子的操作系统+手机,
跟各大应用、平台生态的封杀巨头斗智斗勇,
不如去做这样的手机电脑录屏卡片来切入,
做一个感染所有手机的硬件“外挂病毒”。
包括今天看到消息,说OpenAI可能在做
最快2027年发布的AI手机+OS,
特性是“提升真实物理世界视觉感知”,
但你想想,你每天用的手机,
是手机摄像头拍到的上下文价值多,
还是手机屏幕本身显示的上下文价值多?
很可能哪一天,OpenClaw/Hermes进化到
标配从屏幕视频流,解析保存索引记忆上下文,
对"个人上下文黑匣子"相关硬件的需求就觉醒了。
普通人在龙虾热潮后,即使他装上了龙虾,
不就还是不知道用来干嘛吗?
而不知道用来干嘛,主要瓶颈不就是在于,
他的个人上下文,难以进入龙虾记忆吗?
而普通人的衣食住行工作生活娱乐上下文,
不都在手机屏幕上吗?
基于屏幕的视觉
通杀一切,无需逐个APP去配置,
无视软件霸王限制,无需兼容,24H全自动,
录屏卡片独立工作不额外干扰手机电脑使用,
让Agent真正成为自动了解自己的个人管家。
