以前, 如果我们要去跑那种带有千亿参数的模型,我们得攒成一套总价值超过百万元的服务器集群。而现在, 英伟达这件事就压到了只有四千九百九十九美元这个价格了, 只需要一台桌面设备就可以搞定, 并且在十月二十三日就正式开卖了。
发售时间与渠道
关于DGX SPARK 64GB这款设备, 自2026年10月23日开始, 消费者能够通过英伟达的主要合作伙伴渠道进行购买操作。该产品的起步定价设定为4999美元。
这样的价格区间刚好落在了专业级别的 workstation 与消费级的显卡两者之间。因此来说, 对于有意愿购入该设备的用户来讲, 所面临的门槛实际上并没有显得特别高。
第一批加入的合作伙伴, 涵盖了戴尔这样的企业、联想这样的企业, 还包括Supermicro这样的OEM厂商。海外那边的用户呢, 是可以直接上去把单子下了的。至于国内的情况, 预计是通过英伟达授权的那些代理商, 同步进行铺货的操作。到货的时间, 会比海外的时间稍晚那么一点。
本地推理的实际意义
拥有千亿参数的模型设备, 像Llama 3 405B、DeepSeek V3这种情况, 在以前时期是一定需要使用多台H100显卡或者是A100显卡组合搭建而成的计算集群来完成工作任务的, 如果按照每一个token来单独核算单次进行推理操作时所花费的成本, 这笔钱其实是不便宜的。
而现在只需要花四千九百九十九美元进行一次性付费购买就可以彻底买断相关权限了, 这就直接带来了日常执行推理任务的时候所需成本为零的结果。
更关键的一点是数据不会离开企业内部。在医疗、金融、律所这些行业里面, 大家对隐私数据的管控是非常严格的。如果选择本地部署, 那就意味着所有的数据都会留在自己的 machines 上面, 不会经过任何第三方的云端服务, 这样一来, 合规的压力就大大减少了。
64GB规格与算力表现
64GB的高带宽内存可以同时把千亿参数模型的那些完整权重给加载进去, 它还有英伟达那一代新的GPU架构来配合着一起工作, 这样子的话呢, 这个推理的吞吐量相比上代的DGX那个产品线来说呢是有那种明显的提升的, 然后响应延迟这一点对于日常使用的基本无感。
进行横向对比分析时可以看到, AMD Incell Instinct与Intel Gaudi 3在单卡内存容量这一具体指标上已经达到了比较接近的水平。
然而, CUDA生态系统的成熟度怎么样, 还有相关工具链的完整度究竟有没有到位, 这些点依然是英伟达目前最强硬的壁垒表现。因此, 用户选择切换的时候所面对的成本是非常高的, 并不低廉。
谁最该买
其中最核心的买家群体, 指的是那些从事AI研究工作的人, 以及进行独立开发操作的程序员。他们会在每天的日常时间里, 反复地对种类繁多的不同模型进行各种实验与测试。
因为在云端平台使用API接口时, 费用是按照处理token的数量来收取的, 所以如果把时间拉长到几个月来看, 累计产生的花费就会超过四千九百九十九美元。这样一来相比起来, 在硬件上做出一笔一次性的初始投入, 反而显得更为划算一些。
50人以下的AI创业公司也是主力。他们买不起8卡H100服务器, 但是4999美元的设备足以承担日常开发、模型测试和轻量微调, 每月省下的云租费在几千美元以上。
在英伟达产品家族中的位置
DGX SPARK 64GB这回事, 它的位置是摆在桌面级和边缘AI这两个场景里面的, 它往上头衔接的是像DGX H100、DGX SuperPOD这样的一些数据中心方案。它并不是要去替代什么集群的, 它解决的那个“最后一台机器”到底怎么落地的问题。
简单地说, SuperPOD这个产品, 它是负责进行超大规模的预训练任务的,而DGX SPARK, 它主要是负责日常推理和微调的, 这两者之间, 在英伟达的产品矩阵里面, 是处于一种互补关系的, 它们是面向不同预算水平和不同规模大小的团队的。
能做什么,不能做什么
典型场景包括进行本地部署的客服对话模型应用, 使用能够实现代码补全功能的插件工具, 从事医学影像是辅助阅片操作, 以及执行离线状态下的语音转写业务, 这种模式即便在拔掉网络线缆之后依然能够继续运行工作, 因此对于外部的网络环境不存在任何程度上的依赖。
同样的, 缺点也非常明确: 64GB的内存上限把它锁在了千亿参数模型的范围内, 这意味着它无法进行大规模的预训练工作, 仅仅适合用于推理任务以及少量的LoRA微调操作。此外该设备的功耗和散热要求并不低, 你千万别指望能够把它塞进小小的桌面底下。
你会不会掏4999美元这个钱, 把这千亿规模的模型拉回到本地电脑里来用呢? 你选择继续按照token的用量去支付云端API的费用吗? 请大家在评论区里面说说你们是怎么算这笔账的, 如果你觉我的这个观点还有那么一点用处, 麻烦你就点个赞, 并且把它转帖给你身边那些正在从事AI工作的好朋友。