# 把千亿模型装进笔记本，Windows 终于要反击 Mac 了

- 作者：张子豪
- 发布时间：2026-09-07 18:36
- 分类：产品
- 原文：https://www.ifanr.com/1678877

![](https://s3.ifanr.com/wp-content/uploads/2026/09/ChatGPT-Image6_03_49.png)

AI PC 这个概念喊了两年，终于有人把「本地跑大模型」从演示台搬进了背包。

联想在柏林 IFA 2026 期间的 Lenovo Innovation World 2026 上发布了一系列 AI 终端，手表、手机、平板、笔记本电脑、显示器等等。

其中最重要的产品，毫无疑问是联想联合英伟达推出的 Lenovo Yoga Pro 9n（国内型号：YOGA Pro 15 Spark），这是**一台可以本地运行千亿参数大模型的量产笔记本。**

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776538072-1.png)

这款笔记本重 1.65 千克，最薄 16.7 毫米，最高配备 128GB 统一内存。而按照英伟达对 RTX Spark 的规格说明，**这套配置已经可以在本地运行 1200 亿参数、最高支持 100 万 token 上下文的大语言模型。**

以往我们讨论 AI PC 时，要不就是放在桌面上的专业主机，像是 DGX Spark 和 Mac Studio 等产品，要不就是能让我们为了一只龙虾抢疯的 Mac Mini。

一台笔记本要成为合格的 AI PC，似乎要不就是在硬件上堆到尽可能的极致，要有大内存，要有顶级显卡，然后尽可能保持电脑的尺寸和散热。

或者在软件上，曾经是能无痛安装 OpenClaw 也可以，以及能最大限度的支持各种 AI Agent 的使用，就像 AI 手机一样，AI 能操作的 APP 越多，这个设备就越 AI，电脑同样如此。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776539486-2.png)

但是当 AI PC 也开始走完一个完整的周期：概念走红、参数比拼、用户追问价值。我们也开始想知道，这些算力，到底能在我的电脑上做成什么？

应付实时翻译、会议降噪这类功能级任务或许绰绰有余，但完整的大模型推理，稍微复杂一点的 AI 工作流，仍然要回到云端处理。

本地大模型，更多时候站在演示台上，而不是我们的桌面上。

联想这次推出的 Yoga Pro 9n 换了一条路线，它选择深度接入了英伟达的端侧 AI 架构体系，搭载 NVIDIA RTX Spark 超级芯片，通过 NVLink-C2C 互联，将 20 核 NVIDIA Grace CPU 与 6144 个 CUDA 核心的 Blackwell RTX GPU 合为一体，提供 1 PFLOPS（FP4 精度）的 AI 性能。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776540737-3.png)

一台 Windows 笔记本电脑，也有了成为 Agent 主机的潜力。

## 统一内存成了 AI PC 的新趋势

传统 PC 中，CPU 内存与 GPU 显存相互独立，大模型参数在两者之间反复搬运，**显存的容量往往直接决定能跑多大的模型**。

过去做高性能电脑，独显几乎是标配，但独显峰值算力再强，消费级产品的显存通常也就十几二十 GB，模型稍微大一点，就装不下了。

英伟达 RTX Spark 的统一内存架构则是让 CPU、GPU 共享同一个物理内存池，最高 128GB 对两者同时可用，模型权重、输入数据和中间结果只需保存一份；千亿参数级的大模型也得以在一台笔记本上本地运行。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776542459-4.png)

> 英伟达给出的参考值，是 1200 亿参数、100 万 token 上下文的大语言模型。

开发者可以沿用熟悉的 CUDA 技术栈，数据不必上传云端，项目文档、代码与素材都留在本地。平台还能在后台协调多个 AI 智能体，跨应用自动完成复杂的创作任务。

值得一提的是，联想 X Power 散热架构把 80W TDP 压进了最薄 16.7 毫米的机身，配 15.3 英寸 2.5K 165Hz PureSight Pro OLED 屏；基于 RTX 平台，Yoga 家族也获得了进阶的游戏能力。

开发 AI 应用、剪高分辨率视频、渲染 3D 场景，都可以在这一台机器上完成。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776545591-5.png)

> Luca Rossi，联想集团执行副总裁兼智能设备业务集团（IDG）总裁

同平台的 Lenovo Yoga 9n 2-in-1，则把这份算力装进了一台 360 度翻转创作本：最高 64GB 统一内存，支持「屏幕 + 触控板」双表面手写。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776548395-6.png)

> 2 in 1 是联想的二合一型笔记本电脑

联想不是唯一押注统一内存的玩家。就在前不久，苹果刚刚更新的 Mac mini 和 Mac Studio，几乎也是把本地 AI 计算的性能上限再抬高一截。

Mac mini 提供 M6 和 M5 Pro 两种芯片，统一内存最高 64GB，并且支持通过 Thunderbolt 把多台机器组成集群。

Mac Studio 则提供 M5 Max 与 M5 Ultra，其中 M5 Ultra 版本最高支持 512GB 统一内存、每秒 1.2TB 带宽，按苹果的说法，足以承载数百亿乃至数千亿参数的模型。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776549770-7.png)

今年 6 月 WWDC26 的一场特别活动上，苹果还现场演示过这种集群的玩法：4 台 Mac Studio 通过 Thunderbolt 5 互联，用 LM Studio 基于 MLX Distributed 跑起了万亿参数规模的开放权重模型 Kimi K2.6。官方数据显示，4 机集群的推理性能最高可以达到单机的 3 倍。

苹果笔记本这边，128GB 统一内存的 MacBook Pro（M5 Max）也可以在本地运行 120B 参数的开源模型 gpt-oss-120b，有实测显示最高约 79 token/s，但前提是 4-bit 量化，且长上下文会明显挤占内存。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776551738-8.png)

把两家 PC 更新的方向放在一起，很明显能看到端侧 AI 的瓶颈已经从单纯的算力，转到了「模型装不装得下、数据搬不搬得动」的比拼。苹果用统一内存加 Thunderbolt 集群铺开了从笔记本到桌面的整条线。

联想和英伟达这次的意义，则是把同样的能力第一次带进 Windows + CUDA 生态，并用 FP4 精度和统一内存，把本地上下文的上限推高到了 100 万 token 这个数量级。

## Windows，也开始争夺 Agent 主机

但在这场比拼里，还有一个容易被忽略的变化：Windows 入场了。当我们把这件事放到更大的生态竞争里看，Lenovo Yoga Pro 9n 的意义就不只是停留在「又一台很强的 AI PC」。

过去一段时间里，真正能稳定承载本地大模型、长上下文和多智能体工作流的设备，讨论度往往集中在 Mac 和 Linux 操作系统。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776552948-9.png)

Mac 靠统一内存和 MLX，一只「龙虾」就能让 Mac mini 卖断货；Linux 则是英伟达、工作站和开发者工具链的大本营。

像 DGX Spark 这样的个人 AI 超算，本身就是建立在 Linux 软件栈之上，大量 CUDA 开发和模型部署工具也首先围绕 Linux 成熟起来。

而 Windows 虽然一直是最广泛的个人电脑平台，却很少被视为本地大模型和 Agent 的主场。

现在，随着联想把 RTX Spark 这套能力装进量产笔记本，再把可扩展的小型超算节点带进商用场景，Windows 也开始拥有了承载千亿参数模型和本地 Agent 的现实基础。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776554590-10.png)

> 英伟达 RTX Spark 芯片介绍网页，多款 Windows 电脑搭载了该超级芯片

对于已经围绕 CUDA 开发 AI 应用的人来说，RTX Spark 背后有着 CUDA 多年积累的开发工具、软件库和开发者群体；既有的知识和开发经验可以继续沿用，这也让 Windows 在争夺个人 Agent 主机时，多了一份软件上的吸引力。

当 Mac 正在变成开发者和创作者的本地 AI 工作站时，Windows 也显然不想错过这块市场。

## 笔记本之外，一切都在为 Agent 服务

把算力和内存做大做匀之后，下一个问题是：这些能力为谁准备？联想的答案是 AI Agent。

当 AI 从「有问必答的助手」变成「能自己规划、持续干活的协作者」，它对设备的要求也变了：任务一跑就是几小时，上下文要长期留存，数据和权限都得留在本地。

联想的商用新品 ThinkCentre X Ultra（国内型号：ThinkCentre X Tiny）就是冲着这个需求来的。1.6 升的机身里，塞进了 AMD 锐龙 AI Max+ PRO 495 系列处理器和最高 128GB 统一内存。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776555919-11.png)

> **和 DGX Spark 仅支持 Linux 系统不同，这款超算盒子，联想提供了面向 Windows 和 Linux 的预配置 AI 工具与工作流**

更有意思的是它的扩展方式，最多四台设备可以集群互联成一个统一计算平台，运行更大的模型、更长的上下文和多智能体工作流。

一个部门可以先从一台用起，业务增长、模型变大时再逐台叠加。从「一人一台电脑」到「AI 一台我一台」，办公桌正在变成最小的 AI 算力节点。

除了「千亿参数进笔记本」和这台对标英伟达 DGX Spark 个人超算之外，联想这次的阵容铺得很满，我们简单盘点了一下包括下面这些信息：

- **两款概念机**：Project Aeroblade 用与 Frore Systems 合作的 AirJet 固态主动散热取代风扇，在不足 10 毫米、不到 1000 克的机身里做到无风扇全性能；Project Swan 把卷轴屏带进商用本，合上是 14 英寸，展开是 17 英寸。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776557756-12.png)

- **平板**：Lenovo Yoga Tab Plus Gen 2 / Yoga Tab Gen 2（国内型号：拯救者 Y900 13 / Y900 11），主打笔优先交互，4K 144Hz 屏配 8192 级压感手写笔；Lenovo Smart Canvas Concept 演示了创作在一体机与平板之间跨设备接力。

- **主流与家用**：与潘通合作的七色 IdeaPad Vibe 系列；无中置主机设计的 IdeaCentre AIO i 一体机。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776559410-13.png)

- **商用**：ThinkBook 14 Gen 9（骁龙 X2 Plus，80 TOPS，至高 26 小时视频续航）、12.9 毫米 990 克的 ThinkBook 14x Gen 2、ThinkCentre M75 系列，以及四款 ThinkVision 显示器，其中包括全球首款获微软认证的雷电 VoIP 显示器 P34WD-4v。

- **摩托罗拉**：首款内置 Motorola Qira 的智能手表 moto watch ultra；搭载摩托罗拉史上最高 2 亿像素主摄的 edge 70 plus；镶了 35 颗施华洛世奇水晶的 razr 特别版。

- **个人 AI**：Lenovo \\&amp; Motorola Qira 支持门槛只需要 16GB 内存 PC，随 Android 17 覆盖更多手机平板，并借 Workato 打通邮件与日历；国内的天禧个人智能体升级到 4.3，支持全双工自然语音对话。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776561057-14.png)

## 从买电脑，到买算力

过去两年，Windows 和 Mac 走出了两条截然不同的 AI PC 路线。

Windows 最早最积极地喊着 AI PC，早早就把 AI 变成操作系统的一部分：NPU、Copilot+ PC、实时翻译、Recall，以及越来越多的系统级 AI API。

但真正说到本地跑大模型、搭 AI 工作流，Mac 则凭借统一内存和 MLX，意外成为了开发者最喜欢的本地大模型工作站之一。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776562904-15.png)

前者解决的是「怎么让 PC 多一些 AI 功能」，后者解决的是「怎么让大模型真正跑在 PC 上」。

而 RTX Spark 这样的设备出现之后，Windows 和 macOS 的两条路线开始汇合。

Windows PC 也开始拥有百 GB 级统一内存、千亿参数模型和 CUDA，本地 AI 不再只是系统里的一个功能，而可以成为整台电脑长期运行的工作负载。

模型厂商会更有动力为端侧做蒸馏和量化，开发者也可以基于 CUDA 或 MLX 生态做本地优先的应用，而隐私、延迟和订阅成本这三座大山，或许也开始有了绕开的可能。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776564536-16.png)

顺着这条路往下想，手机、平板、手表未必没有机会跑本地大模型。其实这次联想把 Qira 的支持门槛已经下探到 16GB 内存的 PC，宣布随 Android 17 覆盖更多摩托罗拉手机和平板，甚至让它登上了 moto watch ultra 这块手表。

不过眼下在手腕的端侧模型，还只是一个「调取跨设备记忆」的助手，但内存容量和带宽的爬坡曲线一旦延伸到移动端，端侧模型从笔记本向更小设备扩散，就只是时间问题。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/09/lark2pad-1788776565496-17.png)

下一场 AI PC 的竞争，开始拥有一条更容易理解的衡量标准：

一台电脑有多 AI，不再只看它有多少 AI 功能，还要看有多少原本必须交给云端的工作，现在可以留在你的电脑里完成。

过去这个位置更多属于 Mac 和 Linux，现在 Windows 设备也开始带着统一内存、CUDA 和千亿模型能力加入争夺。

到那时，无论 Windows 还是 macOS，我们买的都将会是一台真正属于自己的 Agent 主机。
