英伟达RTX Spark搭载20核CPU和Blackwell GPU,支持1200亿参数模型
2026.06.01
英伟达面向桌面端推出搭载 **20 核 Grace CPU 与 Blackwell 架构 GPU** 的迷你 AI 超算 **DGX Spark**(部分报道亦称“RTX/DGX Spark”),整机功耗仅约 240W、售价约 3999 美元(约人民币 3 万元),配备 128GB 统一内存与最高 1 PFLOP FP4 算力,可在单机上运行最高约 **2000 亿参数**级别的大模型推理,并支持多机集群扩展更大规模模型。
4 个来源
新品概况与定位:桌面级“个人 AI 超算”

根据英伟达及多家媒体近日公布的信息,DGX Spark 是一款将数据中心级 AI 能力压缩到桌面形态的迷你 AI 超算,体积仅约 1.13 升、整机功耗约 240W,却号称可在桌边提供“个人 AI 云平台”级别的算力。[1][2][3]

快科技与海外评测机构介绍,DGX Spark 售价为 3999 美元,折合人民币约 3 万元出头,远低于传统服务器动辄数十万的价格门槛,目标用户包括个人开发者、小型创业团队、高校与科研机构等,希望以“买一台高端 PC 的预算”获得接近机架服务器的 AI 能力。[1][2]

英伟达在宣传中将其定位为“原生模型开发验证的桌旁设备”,出厂预装 DGX OS、CUDA、cuDNN、TensorRT 及 AI Workbench 等完整软件栈,用户开机即可进行大模型推理、微调与应用开发,而无需自行搭建复杂的驱动与框架环境。[2][3]

业内分析认为,DGX Spark 实际承担了“Project DIGITS”个人 AI 超级电脑落地产品的角色,同时也为后续与联发科合作的 N1X Windows on Arm PC 处理器提供了架构参考和技术验证平台。[4]

核心硬件配置:GB10 Grace Blackwell 超级芯片

DGX Spark 的硬件核心是英伟达 GB10 Grace Blackwell 超级芯片,它在一颗封装内通过 NVLink-C2C 互联集成了 20 核 Grace CPU 与 Blackwell 架构 GPU,可视作一颗高度整合的“CPU+GPU 计算一体 SoC”。[1][2][3]

CPU 部分采用 Arm 架构的 20 核 Grace 处理器,由 10 个高性能 Cortex‑X925 核心与 10 个高能效 Cortex‑A725 核心组成,兼顾大模型推理前后处理、数据加载与传统计算负载。[1][2][3] 这套设计与曝光中的 N1X PC 处理器的 20 核心配置一脉相承,后者同样采用 X925+A725 的大核/小核组合。[4]

GPU 部分基于最新 Blackwell 架构,集成第五代 Tensor Core 与第四代 RT Core,标称最高可提供约 1 PFLOP FP4 稀疏算力,单精度与混合精度下则可提供近百 TFLOPs 级别的矩阵运算能力,在大模型推理与微调场景中远超传统消费级显卡。[1][2]

存储子系统上,DGX Spark 配备 128GB LPDDR5X 统一内存,256-bit 位宽,频率可达 9400MHz,对应原始带宽约 275–301GB/s,相比“CPU 内存 + GPU 显存”分离的传统 PC 方案更有利于大模型全量装载和跨设备数据传输。[1][2][3] 机内还预留 1TB 或 4TB 自加密 NVMe M.2 固态硬盘,用于本地数据集与模型存储。[2][3]

网络与扩展方面,DGX Spark 除了常规的 10GbE 有线网、Wi‑Fi 7、蓝牙 5.4、HDMI 2.1a 等桌面接口外,还集成了 ConnectX‑7 NIC,单端口可提供高达 200Gbps 的结构化网络带宽,为多机集群训练与推理预留了带宽基础。[2][3] 这也是它被称为“迷你服务器”的重要原因。

大模型能力:单机 2000 亿参数、集群扩展至 4000 亿级

在“大模型能跑多大”这一核心指标上,快科技对 DGX Spark 的实测与英伟达给出的数据基本一致:借助 128GB 统一内存与 Blackwell 的高效低精度推理能力,单台设备最高可运行 约 2000 亿参数级别的大模型推理任务。[1] 在更常见的 70B 至约千亿参数模型上,既可做推理,也可在本地完成一定规模的微调与指令对齐工作负载。[1][2]

需要注意的是,2000 亿参数为“技术上可装载并完成推理”的上限,实际可持续运行的模型规模还取决于具体框架的显存/内存管理策略、并行度设置以及用户是否需要同时运行多路推理或其他应用。业内多家评测机构认为,对大多数团队而言,在 DGX Spark 上稳定运行 1000 亿级左右的模型推理,将是较为务实的工程选择。[1][2]

得益于 ConnectX‑7 200Gbps 网络和英伟达 NCCL/MPI 软件栈,用户还可以将两台 DGX Spark 以高速互联的方式组建“小型集群”。电子工程专辑的拆解报道称,官方给出的指标是 双机可支持约 4050 亿参数模型的推理,为团队探索 4000 亿级大模型提供了低门槛途径。[3]

在软件生态上,DGX Spark 出厂支持主流深度学习框架与英伟达全套库,包括 CUDA、cuDNN、TensorRT 以及面向开发者的 AI Workbench 与容器化工作流,开发者可以通过标准 PyTorch、TensorFlow 或各类推理引擎,直接部署如 Llama、Gemma 等开源大模型,或接入自研模型进行微调与服务化部署。[2]

产业与生态影响:从 DGX Spark 到 N1X 的“Blackwell 一体化”

DGX Spark 的发布被视为英伟达在“从数据中心下沉到桌面”的一次关键尝试:它将原本只存在于 DGX 服务器中的 Grace Blackwell 架构缩小到 240W、1.13 升的盒子中,把过去只在机房里才能体验到的 LLM 推理能力搬到了普通办公桌上。[1][2]

更具战略意义的是,业内曝光信息显示,英伟达与联发科合作的 N1X Windows on Arm PC 处理器,很大程度上沿用了 DGX Spark 所在的 GB10 Grace Blackwell 技术路线:同样是 20 核 CPU(Cortex‑X925 + Cortex‑A725 组合),集成基于 Blackwell 的 GPU,拥有 48 个 SM、共 6144 个 CUDA 单元,AI 算力传闻在 180–200 TOPS 量级。[3] 这意味着,从桌旁迷你超算到未来的高性能 Arm PC,英伟达正在尝试构建一个贯通“云—边—端”的 Blackwell 统一生态。

在应用层面,这类“个人 AI 超算”有望显著降低中小团队和个人开发者进入大模型时代的硬件门槛,使得在本地完成千亿级模型推理、隐私数据微调与垂直场景原型验证成为现实,而无需完全依赖公有云 GPU 资源。[4][1][2]

不过,分析人士也指出,DGX Spark 目前仍然定位于高端专业市场:约 3 万元的售价、对电力与散热的要求,以及对 Linux/容器化环境的熟悉程度,意味着它更适合科研机构、AI 创业公司与中大型企业内部创新团队,而非普通消费级用户。[4][1] 随着 N1X 等后续 Blackwell‑Arm 平台进入笔记本和台式机,相关技术有望进一步下放,带来更大规模的普及效应。[3]

本内容由AI生成