# 100 万像素的摄像头，为什么是苹果 AI 最重要的零件？｜硬哲学

- 作者：肖钦鹏
- 发布时间：2026-08-24 10:18
- 分类：产品
- 原文：https://www.ifanr.com/1676333

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_Codex-02_13_56-1.jpg)

前几天，MacRumors 直接从 macOS Tahoe 26.7 RC 里挖出了苹果制作好的宣传视频：戴着 AirPods 拿起一本书，Visual Intelligence 看见书名，再让 Siri 把它保存下来。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_Codex-01_52_51.jpg)

视频里的产品代号是 B790。按照 Mark Gurman 的说法，它原本就在苹果 2026 年的产品路线图上，后续量产版本 B798，则要等到 2027 年。

而最新挖出的系统代码，也第一次让我们看清了这副耳机究竟怎么「看」。其中最有意思的，是一个看起来有些寒酸的参数：

**AirPods 上的摄像头，只有 100 万像素。**

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_gear_airpodcamera_getty.jpg)

▲ 图片来自：WIRED



在手机已经讨论 2 亿像素、8K 视频的今天，苹果给未来 AI 硬件准备的摄像头，实际采集画面甚至可能只有 320×320。

它显然不是用来拍照的。

### AirPods 上的摄像头，为什么只有 100 万像素？

从目前挖出的代码看，这套摄像头至少存在两种工作状态。

主动模式下，摄像头可以采集 640×640 图像，经过处理后最高输出 1024×1024；被动模式则采集 320×320，输出 320×320 或 512×512 图像。

代码显示，左右两只 AirPods 可以同步获取 RGB 静态图像，通过相同的 Frame ID 对齐两个视角，再按照一定频率持续采集，交给 Visual Intelligence 处理。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_00xkcacqh1jjFSWlT0ih5mj-1.fit_lim.size_1600x900.v1749611253.jpg)

系统会同时处理环境语音、周围声音变化、姿态和头部旋转信息；两颗摄像头之间需要标定，摄像头与运动传感器之间也需要校准。如果头部运动过于剧烈，或者镜头被遮挡，对应画面会被直接舍弃。

AccessorySensorManager 中甚至出现了「peripheral inference」相关代码，可以在设备侧判断画面中是否存在人物。

这些，都是喂给 AI 的绝佳数据。

对于 AI 来说，很多时候根本不需要 4800 万像素的照片。模型只需要知道，桌上放着一本书，前面是家餐厅，手里拿着瓶饮料，路牌上写着什么。

320×320 像素已经够用了。

分辨率降下来，数据量随之减少，图像处理和传输的负担也会下降。对于电池只有耳机大小、又需要长时间佩戴的设备来说，功耗和续航是比清晰度更需要考虑的问题。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_AirPods-2-Teardown.jpg)

▲ 图片来自：iFIXIT



过去二十年，消费电子里的摄像头主要服务于人。像素、传感器尺寸、动态范围、色彩，最终都指向同件事：得到好看的照片。

但 AI 摄像头首先服务于机器。

照片甚至不需要留下来。

机器看懂，就可以删掉。

苹果并不是第一个沿着这条路做产品的公司。

今年上市的光帆 AI 全感耳机就是很直接的参照。它同样把摄像头塞进左右两只耳机，采用两颗 200 万像素定焦摄像头，核心用途并非摄影，而是场景 AI 识别。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_guangfan2.jpg)

▲ 光帆 AI 耳机



现实世界先被摄像头转化成视觉数据，再交给模型理解。光帆甚至把 4G eSIM 和 GPS 放进耳机盒，让设备减少对手机的依赖。

200 万还是 100 万像素，在这里没有那么重要。工程问题已经变成：能不能看清，处理要多久，需要传多少数据，又要消耗多少电。

更早的 Humane AI Pin 也尝试过类似思路，用摄像头给 AI 补上视觉。

但 Humane 需要说服人们为了 AI，在胸前额外佩戴新设备。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_Humane-Ai-Pin-Business.jpg)

苹果没有这个问题。

很多人本来就每天戴着 AirPods。

它不需要重新发明 AI 硬件，只需要让已经存在的硬件，长出新的感官。

### AI 时代的 AirPods 不是耳机，而是传感器

事实上，两只 AirPods 耳机，已经组成了一套传感器组合：

摄像头观察眼前有什么，陀螺仪记录头部朝向，麦克风收集周围声音，位置和运动传感器补充人在哪里、正在做什么。

比如走进书店，拿起一本书，然后问 Siri：

「这本值得买吗？」

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_Codex-02_13_56.jpg)

▲ 图片由 AI 生成



单独把这句话交给今天的大模型，它其实什么也不知道。

「这本」是哪一本？

但如果 AirPods 刚刚看到了封面，知道头部正在朝向这本书，同时 iPhone 知道你身处书店，那么 Siri 才真正理解「这本」究竟指什么。

如果系统还知道你过去读过同个作者的两本书，其中一本看完了，另一本只读了三分之一，它甚至可以给出只对你有意义的答案。

这里发生的变化很微妙。

今天我们和 AI 交流时，一直在不停地向它解释自己。

我是谁，我在哪里，我刚刚看到了什么，我手里拿着什么，为什么突然问这个问题。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_Apple-AirPods-lifestyle-240909_big.jpg.large_.jpg)

很多 Prompt，本质上都在人工补充机器缺失的上下文。

摄像头、麦克风和位置、运动状态传感器所做的，就是逐渐把这些解释省掉。

大模型已经知道很多关于世界的事情，却依然知道很少关于「你」的事情。

随身 AI 也不应该每次被唤醒时，都像第一次见到你。

摄像头 AirPods 补上的，恰好就是一种「属于个人的上下文」。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_Apple-Insider.jpg)

▲ 图片来自：Apple Insider



手机拍照是非常明确的动作：拿起手机，打开相机，对准目标。

但耳机不同。

它一直戴在人的头上，因此与周围环境的交互就显得尤为重要。

这次被挖出来的系统代码里，还有个很小的细节：

每只 AirPod 似乎都能够控制硬件指示灯，包括开关和亮度。

如果这对应摄像头的工作状态，那么当 AirPods 获取环境图像时，周围的人可能会通过灯光得到提醒——这倒是很符合苹果一贯的隐私保护策略。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_6-LED-light.jpg)

▲或许会使用类似 Ray-Ban 的 LED 灯提醒



如果摄像头只是偶尔拍张照片，亮灯或许已经足够；但如果它需要以较低频率持续理解环境，问题就复杂了。

因为 AI 需要的并不是某张照片，而是上下文，因此也需要持续打开各项感官，这时候恰当的提醒就非常重要。

从这个角度上看，AirPods 的定位也发生了微妙的变化——不再是单纯的耳机，而是一种新的 AI 硬件形态。

如果诸如此类的变化，不止于 AirPods，而是来到更多苹果产品上呢？

我想这才是苹果在 AI 时代，最重要的战略——这其中最重要的时间节点，就是 2027 年。

### 2027 年，也许正是苹果 AI 元年

2027 年，对苹果而言本来就是特殊的年份——iPhone 发布二十周年。

按照目前的爆料，苹果正在准备大幅改变设计的二十周年 iPhone，而摄像头 AirPods，也可能在同一时期登场。

与此同时，苹果还有几条 AI 硬件产品线正在推进。

除了摄像头 AirPods，还有智能眼镜，以及可以夹在衣服上、或者作为项链佩戴的 AI 挂饰。

此前曝光的产品规划中，也出现过配备摄像头的 Apple Watch，让手表获得观察周围环境的能力。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_Apple-Patents-Putting-A-Camera-In-The-Apple-Watchs-Crown.jpg)

▲ 设想中带摄像头的 Apple Watch 图片来自：Peta Pixel



单独看，它们没有太多关系。

耳机是耳机，眼镜是眼镜，手表是手表。

但如果暂时把「产品」拿掉，只看它们身上的传感器，会看到另一幅图景。

其实这张网络的很多节点，今天已经在我们身上了。

手腕上的 Apple Watch 知道昨晚几点睡着、今天走了多少路；口袋里的 iPhone 知道几点离开公司、去了哪家餐厅；Mac 知道下午打开了哪些文档；AirPods 则几乎一直贴着耳朵。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_apple-health.jpg)

苹果现在准备做的，是给这些设备继续增加感知能力。

过去，这些信息分散在不同设备和 App 里。

心率属于「健康」，照片属于「相册」，位置属于「地图」……

AI 出现以后，它们第一次可以成为同样的东西：上下文。

于是，AirPods 知道听到了什么，也可能知道正在面对什么；Apple Watch 知道身体正在发生什么；iPhone 知道在哪里、正在和谁沟通；Mac 知道正在处理什么工作。

如果智能眼镜最终出现，它还会获得直接的第一人称视角。

**任何设备单独拿出来，都不足以真正理解人，但它们分别掌握着人的不同切面，一经协同，就拥有了对一个人的全景式了解。**

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_Codex-02_15_34.jpg)

▲ 图片由 AI 生成



这也是苹果和许多 AI 硬件创业公司之间很难复制的差别。

过去几年，行业一直在寻找所谓「AI 时代的 iPhone」——

有人做 Pin，有人做项链，有人做眼镜，也有人试图重新发明手机。

在苹果看来，未必需要找到唯一答案。

因为手机、手表、耳机、电脑、平板、头显和家庭设备，它都已经有了。

接下来要做的，是让这些设备拥有丰富的感知能力，再把不同设备获得的信息组织起来。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_Codex-02_26_47.jpg)

最终形成的东西，可能比某款 AI 硬件本身重要得多：

关于人的「个人上下文」。

想象一个很普通的下午：

Apple Watch 知道你昨晚只睡了五个小时，下午又跑了五公里；iPhone 知道十分钟后还有场会议；AirPods 的摄像头看到你站在便利店里，拿起一瓶能量饮料。

然后你问：

「这个适合我吗？」

今天使用 AI，你可能还要先解释自己的睡眠、运动、接下来的安排，以及手里拿着什么。

如果这些信息已经成为上下文，你只需要提问即可。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_context.jpg)

这种能力不来自某颗摄像头，也不来自某款设备，而是围绕个人信息打造的 AI 硬件生态。

大模型当然还会继续进步，但模型正在变成可以替换的能力，今天使用这个，明天可以换另一个。

真正无法快速复制的，是一个人的上下文。

过去五年去了哪里，读过什么，身体发生过什么变化，喜欢什么样的餐厅，什么时间容易疲惫。

这些东西无法通过下载大模型重新获得。

它只能一天一天积累。

这也让苹果过去几年反复强调的端侧计算、Secure Enclave 和 Private Cloud Compute，有了另一层意义。

![](https://s3.ifanr.com/wp-content/uploads/2026/08/BandiView_Private-Cloud-Compute-Apple-Intelligence-AI.jpg)

真正了解你的 AI，需要处理的信息可能比今天的照片、聊天记录和浏览历史还要私人。它不仅知道你说过什么，还可能知道在哪里说、当时看着什么、身体是什么状态，以及最后做出了什么选择。

所以模型能力之外，还有个问题会逐渐变得重要：

谁拥有这些上下文？

苹果最理想的答案当然是，让它尽可能留在用户自己手里——或者说，留在苹果的设备，以及苹果构建的私有计算体系里。

**如果这条路线成立，苹果最终建立的就不只是 AI 设备，而是跨越手机、耳机、手表、眼镜和电脑的感知网络。**

硬件会换，模型也会换。

但如果 AI 已经认识你十年，事情就不一样了。

到那时，人的重要数字资产，可能不再只是照片、文件和聊天记录，还包括只有自己的 AI 硬件生态才能完整拥有的个人上下文——

源自一颗颗摄像头、一枚枚麦克风、一个个传感器——它们不再是为了记住这个世界而存在，而是为了记住你。
