
本文来自微信公众号: 爱范儿 ,作者:发现明日产品的,原文标题:《100 万像素的摄像头,为什么是苹果 AI 最重要的零件?|硬哲学》
前几天,MacRumors直接从macOS Tahoe 26.7 RC里挖出了苹果制作好的宣传视频:戴着AirPods拿起一本书,Visual Intelligence看见书名,再让Siri把它保存下来。
视频里的产品代号是B790。按照Mark Gurman的说法,它原本就在苹果2026年的产品路线图上,后续量产版本B798,则要等到2027年。
而最新挖出的系统代码,也第一次让我们看清了这副耳机究竟怎么「看」。其中最有意思的,是一个看起来有些寒酸的参数:
AirPods上的摄像头,只有100万像素。
在手机已经讨论2亿像素、8K视频的今天,苹果给未来AI硬件准备的摄像头,实际采集画面甚至可能只有320×320。
它显然不是用来拍照的。
AirPods上的摄像头,为什么只有100万像素?
从目前挖出的代码看,这套摄像头至少存在两种工作状态。
主动模式下,摄像头可以采集640×640图像,经过处理后最高输出1024×1024;被动模式则采集320×320,输出320×320或512×512图像。
代码显示,左右两只AirPods可以同步获取RGB静态图像,通过相同的Frame ID对齐两个视角,再按照一定频率持续采集,交给Visual Intelligence处理。
系统会同时处理环境语音、周围声音变化、姿态和头部旋转信息;两颗摄像头之间需要标定,摄像头与运动传感器之间也需要校准。如果头部运动过于剧烈,或者镜头被遮挡,对应画面会被直接舍弃。
AccessorySensorManager中甚至出现了「peripheral inference」相关代码,可以在设备侧判断画面中是否存在人物。
这些,都是喂给AI的绝佳数据。
对于AI来说,很多时候根本不需要4800万像素的照片。模型只需要知道,桌上放着一本书,前面是家餐厅,手里拿着瓶饮料,路牌上写着什么。
320×320像素已经够用了。
分辨率降下来,数据量随之减少,图像处理和传输的负担也会下降。对于电池只有耳机大小、又需要长时间佩戴的设备来说,功耗和续航是比清晰度更需要考虑的问题。

图|iFIXIT
过去二十年,消费电子里的摄像头主要服务于人。像素、传感器尺寸、动态范围、色彩,最终都指向同件事:得到好看的照片。
但AI摄像头首先服务于机器。
照片甚至不需要留下来。机器看懂,就可以删掉。
苹果并不是第一个沿着这条路做产品的公司。今年上市的光帆AI全感耳机就是很直接的参照。它同样把摄像头塞进左右两只耳机,采用两颗200万像素定焦摄像头,核心用途并非摄影,而是场景AI识别。
现实世界先被摄像头转化成视觉数据,再交给模型理解。光帆甚至把4G eSIM和GPS放进耳机盒,让设备减少对手机的依赖。
200万还是100万像素,在这里没有那么重要。工程问题已经变成:能不能看清,处理要多久,需要传多少数据,又要消耗多少电。
更早的Humane AI Pin也尝试过类似思路,用摄像头给AI补上视觉。
但Humane需要说服人们为了AI,在胸前额外佩戴新设备。
苹果没有这个问题。
很多人本来就每天戴着AirPods。它不需要重新发明AI硬件,只需要让已经存在的硬件,长出新的感官。
AI时代的AirPods不是耳机,而是传感器
事实上,两只AirPods耳机,已经组成了一套传感器组合:
摄像头观察眼前有什么,陀螺仪记录头部朝向,麦克风收集周围声音,位置和运动传感器补充人在哪里、正在做什么。
比如走进书店,拿起一本书,然后问Siri:「这本值得买吗?」
单独把这句话交给今天的大模型,它其实什么也不知道。
「这本」是哪一本?
但如果AirPods刚刚看到了封面,知道头部正在朝向这本书,同时iPhone知道你身处书店,那么Siri才真正理解「这本」究竟指什么。
如果系统还知道你过去读过同个作者的两本书,其中一本看完了,另一本只读了三分之一,它甚至可以给出只对你有意义的答案。
这里发生的变化很微妙。
今天我们和AI交流时,一直在不停地向它解释自己。我是谁,我在哪里,我刚刚看到了什么,我手里拿着什么,为什么突然问这个问题。
很多Prompt,本质上都在人工补充机器缺失的上下文。
摄像头、麦克风和位置、运动状态传感器所做的,就是逐渐把这些解释省掉。
大模型已经知道很多关于世界的事情,却依然知道很少关于「你」的事情。
随身AI也不应该每次被唤醒时,都像第一次见到你。摄像头AirPods补上的,恰好就是一种「属于个人的上下文」。

图|Apple Insider
手机拍照是非常明确的动作:拿起手机,打开相机,对准目标。
但耳机不同。它一直戴在人的头上,因此与周围环境的交互就显得尤为重要。
这次被挖出来的系统代码里,还有个很小的细节:
每只AirPod似乎都能够控制硬件指示灯,包括开关和亮度。
如果这对应摄像头的工作状态,那么当AirPods获取环境图像时,周围的人可能会通过灯光得到提醒——这倒是很符合苹果一贯的隐私保护策略。

如果摄像头只是偶尔拍张照片,亮灯或许已经足够;但如果它需要以较低频率持续理解环境,问题就复杂了。
因为AI需要的并不是某张照片,而是上下文,因此也需要持续打开各项感官,这时候恰当的提醒就非常重要。
从这个角度上看,AirPods的定位也发生了微妙的变化——不再是单纯的耳机,而是一种新的AI硬件形态。
如果诸如此类的变化,不止于AirPods,而是来到更多苹果产品上呢?
我想这才是苹果在AI时代,最重要的战略。而其中最重要的时间节点,就是2027年。
2027年,也许正是苹果AI元年
2027年,对苹果而言本来就是特殊的年份——iPhone发布二十周年。
按照目前的爆料,苹果正在准备大幅改变设计的二十周年iPhone,而摄像头AirPods,也可能在同一时期登场。
与此同时,苹果还有几条AI硬件产品线正在推进。
除了摄像头AirPods,还有智能眼镜,以及可以夹在衣服上、或者作为项链佩戴的AI挂饰。
此前曝光的产品规划中,也出现过配备摄像头的Apple Watch,让手表获得观察周围环境的能力。
单独看,它们没有太多关系。
耳机是耳机,眼镜是眼镜,手表是手表。
但如果暂时把「产品」拿掉,只看它们身上的传感器,会看到另一幅图景。
上下文网络的很多节点,今天已经在我们身上了。
手腕上的Apple Watch知道昨晚几点睡着、今天走了多少路;口袋里的iPhone知道几点离开公司、去了哪家餐厅;Mac知道下午打开了哪些文档;AirPods则几乎一直贴着耳朵。

苹果现在准备做的,是给这些设备继续增加感知能力。
过去,这些信息分散在不同设备和App里。心率属于「健康」,照片属于「相册」,位置属于「地图」……
AI出现以后,它们第一次可以成为同样的东西:上下文。
于是,AirPods知道听到了什么,也可能知道正在面对什么;Apple Watch知道身体正在发生什么;iPhone知道在哪里、正在和谁沟通;Mac知道正在处理什么工作。如果智能眼镜最终出现,它还会获得直接的第一人称视角。
任何设备单独拿出来,都不足以真正理解人,但它们分别掌握着人的不同切面,一经协同,就拥有了对一个人的全景式了解。
这也是苹果和许多AI硬件创业公司之间很难复制的差别。
过去几年,行业一直在寻找所谓「AI时代的iPhone」——
有人做Pin,有人做项链,有人做眼镜,也有人试图重新发明手机。
在苹果看来,未必需要找到唯一答案。
因为手机、手表、耳机、电脑、平板、头显和家庭设备,它都已经有了。接下来要做的,是让这些设备拥有丰富的感知能力,再把不同设备获得的信息组织起来。
最终形成的东西,可能比某款AI硬件本身重要得多:
关于人的「个人上下文」。
想象一个很普通的下午:Apple Watch知道你昨晚只睡了五个小时,下午又跑了五公里;iPhone知道十分钟后还有场会议;AirPods的摄像头看到你站在便利店里,拿起一瓶能量饮料。
然后你问:
「这个适合我吗?」
今天使用AI,你可能还要先解释自己的睡眠、运动、接下来的安排,以及手里拿着什么。如果这些信息已经成为上下文,你只需要提问即可。

这种能力不来自某颗摄像头,也不来自某款设备,而是围绕个人信息打造的AI硬件生态。
大模型当然还会继续进步,但模型正在变成可以替换的能力,今天使用这个,明天可以换另一个。
真正无法快速复制的,是一个人的上下文。
过去五年去了哪里,读过什么,身体发生过什么变化,喜欢什么样的餐厅,什么时间容易疲惫。
这些东西无法通过下载大模型重新获得。
它只能一天一天积累。
这也让苹果过去几年反复强调的端侧计算、Secure Enclave和Private Cloud Compute,有了另一层意义。
真正了解你的AI,需要处理的信息可能比今天的照片、聊天记录和浏览历史还要私人。
它不仅知道你说过什么,还可能知道在哪里说、当时看着什么、身体是什么状态,以及最后做出了什么选择。
所以模型能力之外,还有个问题会逐渐变得重要:
谁拥有这些上下文?
苹果最理想的答案当然是,让它尽可能留在用户自己手里——或者说,留在苹果的设备,以及苹果构建的私有计算体系里。
如果这条路线成立,苹果最终建立的就不只是AI设备,而是跨越手机、耳机、手表、眼镜和电脑的感知网络。
硬件会换,模型也会换。但如果AI已经认识你十年,事情就不一样了。
到那时,人的重要数字资产,可能不再只是照片、文件和聊天记录,还包括只有自己的AI硬件生态才能完整拥有的个人上下文——
源自一颗颗摄像头、一枚枚麦克风、一个个传感器——它们不再是为了记住这个世界而存在,而是为了记住你。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。