paulwei on X: "我两套服役中的NAS硬盘有200TB(如图) 但AI Agent却没法记录我点外卖的口味,喜欢吃啥。 今天我想把大众点评收藏餐厅列表导出, 给我的Agent让它了解我的美食记忆上下文, 我点“个人信息下载”-填写邮箱,像X的导出似的, 它也郑重其事地给我发了一个邮件,带了个TXT附件, 打开一看,好家伙,就是份几十个字的个人资料。 想导出外卖订单记录,更是无果。 可这些数据明明是我自己的不是吗? 我在屏幕上可以看,却不让我导出。 巧妇难为无米之炊。 当今Agent的记忆,全靠用户花费时间精力注意力, 主动去喂,无论是打字、说话、传数据,都是如此, 即使是国际互联网生态的个人上下文走MCP/API流动, 对普通人来说也是处处壁垒门槛和麻烦。 人的注意力,就是Agent记忆上下文的最大瓶颈, 而个人上下文记忆,就是Agent用例的最大瓶颈。 也许你在想,如果穿戴式摄像头发展到位, 就能实现“自动无感输入上下文”了, 比如智能眼镜,挂脖子的项链记录仪, 甚至带摄像头的耳机“VisionPods” 等等形态。 但这些都还需时日,且物理世界的视觉 信息密度低,隐私阻力大,识别复杂度高等等。 当代人大部分信息都在手机/电脑屏幕上了, 所以最快可行的视觉记忆“自动记录仪”形态, 就是Plaud AI这种吸在手机背面的录音卡片, 加上USB-C连接,就能24小时录屏手机画面 (原理同XReal智能眼镜投屏), 比磁吸充电宝轻巧得多; 或者电脑HDMI口插上视频采集盒, 并配套从录屏解析导出结构化上下文的软件。 那么无论你在手机/电脑上做什么, 点外卖网购、打游戏看剧、聊天、刷推、工作... 录屏卡片都能以视频数据的形式, 记录下来,同时作为上下文喂给Agent。 C端个人AI时代下, API/MCP/CLI... 是理想主义者眼中的结构化世界入口, 而屏幕视频流才是混沌APP世界的现实入口, 让我的个人数据真正能为我所用。 就像Elon Musk用坚持第一性原理, 坚持用视觉模型做真正的自动驾驶, 而不是指望“精确的激光雷达”, 也不是指望全球道路来兼容自动驾驶。 豆包手机团队与其做掀桌子的操作系统+手机, 跟各大应用、平台生态的封杀巨头斗智斗勇, 不如去做这样的手机电脑录屏卡片来切入, 做一个感染所有手机的硬件“外挂病毒”。 包括今天看到消息,说OpenAI可能在做 最快2027年发布的AI手机+OS, 特性是“提升真实物理世界视觉感知”, 但你想想,你每天用的手机, 是手机摄像头拍到的上下文价值多, 还是手机屏幕本身显示的上下文价值多? 很可能哪一天,OpenClaw/Hermes进化到 标配从屏幕视频流,解析保存索引记忆上下文, 对"个人上下文黑匣子"相关硬件的需求就觉醒了。 普通人在龙虾热潮后,即使他装上了龙虾, 不就还是不知道用来干嘛吗? 而不知道用来干嘛,主要瓶颈不就是在于, 他的个人上下文,难以进入龙虾记忆吗? 而普通人的衣食住行工作生活娱乐上下文, 不都在手机屏幕上吗? 基于屏幕的视觉 通杀一切,无需逐个APP去配置, 无视软件霸王限制,无需兼容,24H全自动, 录屏卡片独立工作不额外干扰手机电脑使用, 让Agent真正成为自动了解自己的个人管家。"

我两套服役中的NAS硬盘有200TB(如图) 但AI Agent却没法记录我点外卖的口味,喜欢吃啥。 今天我想把大众点评收藏餐厅列表导出, 给我的Agent让它了解我的美食记忆上下文, 我点“个人信息下载”-填写邮箱,像X的导出似的, 它也郑重其事地给我发了一个邮件,带了个TXT附件, 打开一看,好家伙,就是份几十个字的个人资料。 想导出外卖订单记录,更是无果。 可这些数据明明是我自己的不是吗? 我在屏幕上可以看,却不让我导出。 巧妇难为无米之炊。 当今Agent的记忆,全靠用户花费时间精力注意力, 主动去喂,无论是打字、说话、传数据,都是如此, 即使是国际互联网生态的个人上下文走MCP/API流动, 对普通人来说也是处处壁垒门槛和麻烦。 人的注意力,就是Agent记忆上下文的最大瓶颈, 而个人上下文记忆,就是Agent用例的最大瓶颈。 也许你在想,如果穿戴式摄像头发展到位, 就能实现“自动无感输入上下文”了, 比如智能眼镜,挂脖子的项链记录仪, 甚至带摄像头的耳机“VisionPods” 等等形态。 但这些都还需时日,且物理世界的视觉 信息密度低,隐私阻力大,识别复杂度高等等。 当代人大部分信息都在手机/电脑屏幕上了, 所以最快可行的视觉记忆“自动记录仪”形态, 就是Plaud AI这种吸在手机背面的录音卡片, 加上USB-C连接,就能24小时录屏手机画面 (原理同XReal智能眼镜投屏), 比磁吸充电宝轻巧得多; 或者电脑HDMI口插上视频采集盒, 并配套从录屏解析导出结构化上下文的软件。 那么无论你在手机/电脑上做什么, 点外卖网购、打游戏看剧、聊天、刷推、工作... 录屏卡片都能以视频数据的形式, 记录下来,同时作为上下文喂给Agent。 C端个人AI时代下, API/MCP/CLI... 是理想主义者眼中的结构化世界入口, 而屏幕视频流才是混沌APP世界的现实入口, 让我的个人数据真正能为我所用。 就像Elon Musk用坚持第一性原理, 坚持用视觉模型做真正的自动驾驶, 而不是指望“精确的激光雷达”, 也不是指望全球道路来兼容自动驾驶。 豆包手机团队与其做掀桌子的操作系统+手机, 跟各大应用、平台生态的封杀巨头斗智斗勇, 不如去做这样的手机电脑录屏卡片来切入, 做一个感染所有手机的硬件“外挂病毒”。 包括今天看到消息,说OpenAI可能在做 最快2027年发布的AI手机+OS, 特性是“提升真实物理世界视觉感知”, 但你想想,你每天用的手机, 是手机摄像头拍到的上下文价值多, 还是手机屏幕本身显示的上下文价值多? 很可能哪一天,OpenClaw/Hermes进化到 标配从屏幕视频流,解析保存索引记忆上下文, 对"个人上下文黑匣子"相关硬件的需求就觉醒了。 普通人在龙虾热潮后,即使他装上了龙虾, 不就还是不知道用来干嘛吗? 而不知道用来干嘛,主要瓶颈不就是在于, 他的个人上下文,难以进入龙虾记忆吗? 而普通人的衣食住行工作生活娱乐上下文, 不都在手机屏幕上吗? 基于屏幕的视觉 通杀一切,无需逐个APP去配置, 无视软件霸王限制,无需兼容,24H全自动, 录屏卡片独立工作不额外干扰手机电脑使用, 让Agent真正成为自动了解自己的个人管家。
@coolish
May 4
现在都在做可穿戴摄像头,也许还不如先做个: 从 手机电脑USB-C / HDMI 插口录屏记录仪 +配套从录屏视频解析导出结构化上下文软件 (导出给AI Agent用) 相当于录屏版的 Plaud AI, 且录屏分析需求,比录音分析需求更高频, 使用场景更广泛无数倍, 也许能成为未来 AI 视觉方案的最佳切入口。
7:43 AM · May 5, 2026
19.1K
Views