小侠说·深度分析|云栖大会阿里V900硬刚昇腾960
展开
2026年9月27日 · 周日
小侠说·深度分析|云栖大会阿里V900硬刚昇腾960
9月22日至24日,云栖大会从杭州云栖小镇搬到了国际博览中心,主题"智以致用"。吴泳铭甩出两个判断:机器思考总量将达人类1000倍、机器智能时代的代表性产品还没出现。更硬的是产品——平头哥真武V900性能翻3倍、216GB显存、2027年一季度量产;磐久AL64全球首款 SNPO 光互连超节点。这刚好撞上9月17日华为的昇腾960。阿里、华为、英伟达,三家把"一台计算机"推到了同一个考场:2027年第一季度。
———— ✦ 正文开始 ✦ ————
一、云栖变了:从"小镇草坪"到"为Agent重造的云"今年的云栖,氛围变了。会场从云栖小镇换到杭州国际博览中心,空间更规整,感官上人却似乎少了——去年在户外草坪随处坐下聊天的随意感,今年变成了正经的会议。一位参会者说,"云栖还在,熟悉的那种感觉却没能一起搬过来"。
但主题更锋利了:智以致用。吴泳铭给了两个判断、一个比喻。判断一:机器的思考总量将达到人类的1000倍以上,今天这个比例还不到3%——他的参照是动力革命,机器动力已承担99.9%的物理工作,思考预计也将承担99.9%。判断二:机器智能时代的代表性产品,还没有出现。比喻是:今天的AI编程,只相当于1882年的电灯,爱迪生点亮第一座商用电站时,人们用它替代煤油灯,而空调、冰箱、洗衣机是几十年后的事。
三个说法指向同一件事:思考正在变成可以规模化生产的商品,而行业还处在"电站刚建成"的阶段。对阿里这样国内少数同时在自研AI芯片、大模型和AI云上重注的厂商,接下来的问题很具体:电站怎么建、电网怎么铺、电用什么发。本届大会,这条链条第一次被拆成一串具体数字:芯片代际性能×3、AI存储成本-69%、模型零人工干预迭代33轮、单一集群50万卡。
二、真武V900:三年九倍背后的代际节奏真武V900是平头哥第三代训推一体AI芯片。按官方说法,单芯片性能是上一代真武M890的3倍,搭载216GB显存,片间互联带宽1200GB/s,原生支持FP8、FP4低精度计算,可同时覆盖高精度训练和低精度推理;量产时间定在2027年第一季度,比原计划提前约两个季度,官方称它是"目前算力性能最强的中国自研AI芯片"。
真正有信息量的不是单点参数,而是迭代节奏:2024年的810E(96GB显存、700GB/s互联)→ 2026年二季度的M890(144GB、800GB/s,性能3倍于810E)→ 2027年一季度的V900(216GB、1200GB/s,再翻3倍)→ 2028年三季度的J900。一年一代、每代翻三倍,按官方倍数连乘,从810E到V900约9倍。这个节奏已经跑了三代。
商业面上,截至4月真武系列累计出货56万片,截至6月服务客户超过650家;按IDC统计的2025年数据,平头哥在国产云端AI加速器厂商中位列第二,份额约16%。整场发布也留了一个空白:从头到尾没有给出绝对算力数字——单卡多少 TFLO PS、什么精度下的多少PFLOPS,一律缺席。"3倍"也没限定条件:什么精度、稠密还是稀疏、按单芯还是整机。等V900和昇腾960在同一个交付窗口里碰面,外界自然会用同一张表把它们补齐。
不止芯片。同场首次公布路线图的倚天服务器CPU,指向一个判断:Agent时代CPU回到了关键路径,任务规划、工具调用、代码沙箱都依赖单核性能与内存带宽。2027年的倚天730采用全自研微架构、单核性能最高提升到倚天710的1.4倍,倚天720以192核支撑大规模并发,倚天750将通过ICN总线与真武芯片直接互联。加上磐脉920网卡、镇岳510存储主控与ICN互联芯片,平头哥已把数据中心的核心芯片补齐。
三、磐久超节点:把上千张卡变成"一颗超级芯片"V900发布真正的主角,是系统。当集群规模上万卡,芯片之间的通信会吃掉大量训练时间——华为公开的估算是四成以上;单卡再快,系统跟不上也是空转。平头哥的解法是ICN Switch互联芯片:在超节点里让卡与卡之间具备原生内存语义和内存统一编址,实现千卡全带宽高速互联,统一显存规模达百TB级,上层软件不必再关心数据放在哪台服务器,上千颗V900更像一颗"超级芯片"。
同一天下午,阿里云发布磐久AL64——全球首个把SNPO(Scale-Up NPO,面向多卡紧耦合互联域的近封装光学)做进产品的超节点服务器:单机64卡、无收敛扩展至1024卡,把光模块从机柜面板搬到计算芯片旁边。动因是铜的传输距离在超大规模Scale-Up域里已经不够用。SNPO由阿里云与开放数据中心委员会(ODCC)牵头开放,不绑定任何一家的计算芯片与交换体系;曦智科技同场首发了3.2T/6.4T的SNPO硅光芯片。
三款超节点并非取代关系,而是同一条战略下的三条演进轴线:AL128守住"开放解耦、当下可用"(128卡、单柜350kW、已规模部署);AL64押注"光互连、突破铜天花板"(2026云栖正式发布);AL144冲刺"全液冷、最高功率密度"(144卡、整柜650kW、GPU TBP突破3500W、800V HVDC垂直供电)。按2026年7月发布的《超节点定义与实践白皮书》(鹏城实验室与全球计算联盟牵头、38家单位参与),超节点的核心特征正是"让几千张卡在软件眼里像一台机器"——单一集群可扩展至50万卡。
四、三方同考2027Q1:华为昇腾960、阿里V900、英伟达B300过去一个月,三家公司先后交代了AI基础设施的下一步:华为在9月17日全联接大会发布昇腾960超节点,阿里在云栖亮出V900,英伟达的B300已量产出货。把三家的牌摆上同一张桌,最先撞进视线的是趋同——华为说"把竞争单位从单颗芯片扩大到整个系统",阿里说"像一颗超级芯片",英伟达的机柜级方案叫NVL72,三家都在把"一台计算机"往前推。
先看单卡:华为昇腾960DT,2027Q1就绪,288GB HBM,9.6TB/s扩展互联;阿里真武V900,216GB、1200GB/s片间,2027Q1量产;英伟达B300,288GB HBM3e、约8TB/s、NVLink 1.8TB/s,已量产在售。容量上V900的216GB对小一档,单卡容量直接决定万亿参数模型的切分策略;而V900的算力一栏是空的。
再看系统:华为昇腾960超节点单域4096卡,提供8 EFLOPS FP8算力与1PB内存,域内往返时延最低2微秒,组网后最大集群51.2万卡、向100万卡扩展;阿里V900超节点以"千卡全带宽+统一编址"为特征,集群上限50万卡,用SNPO把光接进Scale-Up域;英伟达仍是机柜优先,NVL72一台机柜72颗GPU、铜缆全互联。两条中国路线的相似度值得标注:都把光互连推进到近封装(华为用自研NPO替代4.8万颗可插拔光模块、功耗降超550千瓦;阿里用开放SNPO解耦供应链),都公开集群上限翻过50万卡,也都选择了"统一内存编址"这个说法。
最后是时间表,它把三家拉到了同一个考场:960DT与V900都指向2027年第一季度,B300已量产在售、下一代爬坡中。那是第一次可以用同一批公开数据做三方实测的窗口——能不能准时交付、软件栈是否就绪、超节点在真实训练任务里能否兑现理论算力,都会在那时见分晓。需要说明的是,昇腾960DT为华为官方数字,B300为媒体整理,V900无绝对值披露,三种信度并存。
五、模型开始改硬件:RSI递归自改进意味着什么比单点提分更值得记录的是RSI(递归自我改进)。大会披露:Qwen3.8-Max在人类完全零参与的情况下,自主搭建训练流程、构造训练数据、设计实验、定位缺陷,持续迭代超过1个月,完成33轮有效迭代(平均约每天一轮),智能指数从40分升到45分,跨进海外顶级模型所在的分数区间,官方称其领先当前所有国产模型。
RSI的外溢比分数更具体——模型同时在供给链的两端动手。软件侧,它先完成了此前从未接触过的平头哥新款GPU的适配:从零搭起Qwen3.8-Flash-Next的推理框架,长文本首token延迟下降47%,每输出token延迟下降60%,日常对话场景单实例吞吐提升96%。硬件侧,它拿一份真实的芯片模块规范,自主运行超过60小时、调用EDA工具超过一万次,把模块物理面积减少42%——在"AI参与设计芯片"的各种说法里,这是一个相对硬的工程结果。
规模这条线没有停。Qwen4正在以全新架构训练中,后续的Qwen4.5、Qwen5计划把总参数扩展到5万亿至10万亿;Qwen3.8-Flash提前开源下一代架构,训练成本下降约90%,推理时几十亿级激活参数就能达到前沿性能,缓存价格压到每百万tokens一毛钱;开源盘子继续扩大,460多个开源模型、累计下载超30亿次、衍生模型超30万个。
意义在于:迭代速度不再受人类工作时长的限制,模型开始改造自己的工具链与硬件链,下一轮能力提升由此多出一个来源。但要带两个限定:起点与评价体系仍是人搭的(预训练基座、评测集、初始框架都是人类资产);45分本身也不是代差,且尚无第三方复现。读的时候,把它当成"能力增长方式变了"的信号,而不是"已经超越"的结论。
六、普通人怎么看:国产算力自主可控
① 从"单芯片"走向"芯片—互连—整机—集群"全栈。 阿里、华为两条线殊途同归,都把光互连推进近封装、都公开50万卡集群上限,国产算力自主可控能力在实质增强,不是PPT叙事。
② 关注"光互连"这个新变量。 SNPO/NPO把光从机柜面板搬到芯片旁边,是下一阶段算力密度突破铜天花板的关键,相关硅光、光模块产业链值得长期跟踪,但区分"开放规范"与"真金白银量产"。
③ 别把PPT算力当现实交付。 V900无绝对值披露、2027Q1才量产;昇腾960同样要等实测。发布会掌声大,不等于产能和软件栈已就绪。
④ 投资看"交付节奏+软件栈成熟度",不是看发布会。 好技术不缺关注,缺的是兑现——能不能准时交货、生态里有多少人真跟进,才是硬指标。
全文总结
9月22日至24日云栖大会,阿里把"芯片—模型—云"全家桶一次性摆上台:平头哥真武V900性能较上代M890翻3倍、216GB显存、2027Q1量产,路线图一年一代每代3倍、810E到V900约9倍,累计出货56万片、国产云端AI加速器份额约16%,但全程未披露绝对算力数字;磐久AL64是全球首款SNPO光互连超节点(单机64卡、无收敛扩展1024卡、把光搬到芯片旁),与AL128(已规模部署)、AL144(全液冷650kW)构成三条演进轴线,单一集群可扩展50万卡。这刚好撞上9月17日华为昇腾960——三方把"一台计算机"推到同一考场:华为960DT(288GB HBM、4096卡、8EFLOPS、51.2万卡)、阿里V900(216GB、2027Q1)、英伟达B300(已量产、288GB HBM3e),都押注近封装光互连、都公开50万卡上限、都讲"统一内存编址",2027Q1是首次可三方实测的窗口。更深层的变化是RSI递归自改进:Qwen3.8-Max零人工完成33轮迭代、智能指数40→45,并自主适配新GPU(首token延迟-47%、吞吐+96%)和改硬件(物理面积-42%),模型开始改造自己的工具链与硬件链;Qwen4/4.5/5计划推至5—10万亿参数、训练成本-90%、每百万token一毛钱。国产算力从单芯片走向全栈自主可控是实打实的趋势,但V900无绝对值、2027Q1才量产,投资要看交付节奏与软件栈成熟度,而非发布会掌声。
免责声明:本文仅为基于公开发布会与新闻的数据梳理与逻辑分析,不构成任何投资建议。股市有风险,投资需谨慎。文中提及企业与数据均来自公开渠道,可能存在延迟或误差,请以公司官方披露为准。
以 上
丨小侠说丨
小侠说·深度分析|云栖大会阿里V900硬刚昇腾960
9月22日至24日,云栖大会从杭州云栖小镇搬到了国际博览中心,主题"智以致用"。吴泳铭甩出两个判断:机器思考总量将达人类1000倍、机器智能时代的代表性产品还没出现。更硬的是产品——平头哥真武V900性能翻3倍、216GB显存、2027年一季度量产;磐久AL64全球首款 SNPO 光互连超节点。这刚好撞上9月17日华为的昇腾960。阿里、华为、英伟达,三家把"一台计算机"推到了同一个考场:2027年第一季度。
———— ✦ 正文开始 ✦ ————
一、云栖变了:从"小镇草坪"到"为Agent重造的云"今年的云栖,氛围变了。会场从云栖小镇换到杭州国际博览中心,空间更规整,感官上人却似乎少了——去年在户外草坪随处坐下聊天的随意感,今年变成了正经的会议。一位参会者说,"云栖还在,熟悉的那种感觉却没能一起搬过来"。
但主题更锋利了:智以致用。吴泳铭给了两个判断、一个比喻。判断一:机器的思考总量将达到人类的1000倍以上,今天这个比例还不到3%——他的参照是动力革命,机器动力已承担99.9%的物理工作,思考预计也将承担99.9%。判断二:机器智能时代的代表性产品,还没有出现。比喻是:今天的AI编程,只相当于1882年的电灯,爱迪生点亮第一座商用电站时,人们用它替代煤油灯,而空调、冰箱、洗衣机是几十年后的事。
三个说法指向同一件事:思考正在变成可以规模化生产的商品,而行业还处在"电站刚建成"的阶段。对阿里这样国内少数同时在自研AI芯片、大模型和AI云上重注的厂商,接下来的问题很具体:电站怎么建、电网怎么铺、电用什么发。本届大会,这条链条第一次被拆成一串具体数字:芯片代际性能×3、AI存储成本-69%、模型零人工干预迭代33轮、单一集群50万卡。
二、真武V900:三年九倍背后的代际节奏真武V900是平头哥第三代训推一体AI芯片。按官方说法,单芯片性能是上一代真武M890的3倍,搭载216GB显存,片间互联带宽1200GB/s,原生支持FP8、FP4低精度计算,可同时覆盖高精度训练和低精度推理;量产时间定在2027年第一季度,比原计划提前约两个季度,官方称它是"目前算力性能最强的中国自研AI芯片"。
真正有信息量的不是单点参数,而是迭代节奏:2024年的810E(96GB显存、700GB/s互联)→ 2026年二季度的M890(144GB、800GB/s,性能3倍于810E)→ 2027年一季度的V900(216GB、1200GB/s,再翻3倍)→ 2028年三季度的J900。一年一代、每代翻三倍,按官方倍数连乘,从810E到V900约9倍。这个节奏已经跑了三代。
商业面上,截至4月真武系列累计出货56万片,截至6月服务客户超过650家;按IDC统计的2025年数据,平头哥在国产云端AI加速器厂商中位列第二,份额约16%。整场发布也留了一个空白:从头到尾没有给出绝对算力数字——单卡多少 TFLO PS、什么精度下的多少PFLOPS,一律缺席。"3倍"也没限定条件:什么精度、稠密还是稀疏、按单芯还是整机。等V900和昇腾960在同一个交付窗口里碰面,外界自然会用同一张表把它们补齐。
不止芯片。同场首次公布路线图的倚天服务器CPU,指向一个判断:Agent时代CPU回到了关键路径,任务规划、工具调用、代码沙箱都依赖单核性能与内存带宽。2027年的倚天730采用全自研微架构、单核性能最高提升到倚天710的1.4倍,倚天720以192核支撑大规模并发,倚天750将通过ICN总线与真武芯片直接互联。加上磐脉920网卡、镇岳510存储主控与ICN互联芯片,平头哥已把数据中心的核心芯片补齐。
三、磐久超节点:把上千张卡变成"一颗超级芯片"V900发布真正的主角,是系统。当集群规模上万卡,芯片之间的通信会吃掉大量训练时间——华为公开的估算是四成以上;单卡再快,系统跟不上也是空转。平头哥的解法是ICN Switch互联芯片:在超节点里让卡与卡之间具备原生内存语义和内存统一编址,实现千卡全带宽高速互联,统一显存规模达百TB级,上层软件不必再关心数据放在哪台服务器,上千颗V900更像一颗"超级芯片"。
同一天下午,阿里云发布磐久AL64——全球首个把SNPO(Scale-Up NPO,面向多卡紧耦合互联域的近封装光学)做进产品的超节点服务器:单机64卡、无收敛扩展至1024卡,把光模块从机柜面板搬到计算芯片旁边。动因是铜的传输距离在超大规模Scale-Up域里已经不够用。SNPO由阿里云与开放数据中心委员会(ODCC)牵头开放,不绑定任何一家的计算芯片与交换体系;曦智科技同场首发了3.2T/6.4T的SNPO硅光芯片。
三款超节点并非取代关系,而是同一条战略下的三条演进轴线:AL128守住"开放解耦、当下可用"(128卡、单柜350kW、已规模部署);AL64押注"光互连、突破铜天花板"(2026云栖正式发布);AL144冲刺"全液冷、最高功率密度"(144卡、整柜650kW、GPU TBP突破3500W、800V HVDC垂直供电)。按2026年7月发布的《超节点定义与实践白皮书》(鹏城实验室与全球计算联盟牵头、38家单位参与),超节点的核心特征正是"让几千张卡在软件眼里像一台机器"——单一集群可扩展至50万卡。
四、三方同考2027Q1:华为昇腾960、阿里V900、英伟达B300过去一个月,三家公司先后交代了AI基础设施的下一步:华为在9月17日全联接大会发布昇腾960超节点,阿里在云栖亮出V900,英伟达的B300已量产出货。把三家的牌摆上同一张桌,最先撞进视线的是趋同——华为说"把竞争单位从单颗芯片扩大到整个系统",阿里说"像一颗超级芯片",英伟达的机柜级方案叫NVL72,三家都在把"一台计算机"往前推。
先看单卡:华为昇腾960DT,2027Q1就绪,288GB HBM,9.6TB/s扩展互联;阿里真武V900,216GB、1200GB/s片间,2027Q1量产;英伟达B300,288GB HBM3e、约8TB/s、NVLink 1.8TB/s,已量产在售。容量上V900的216GB对小一档,单卡容量直接决定万亿参数模型的切分策略;而V900的算力一栏是空的。
再看系统:华为昇腾960超节点单域4096卡,提供8 EFLOPS FP8算力与1PB内存,域内往返时延最低2微秒,组网后最大集群51.2万卡、向100万卡扩展;阿里V900超节点以"千卡全带宽+统一编址"为特征,集群上限50万卡,用SNPO把光接进Scale-Up域;英伟达仍是机柜优先,NVL72一台机柜72颗GPU、铜缆全互联。两条中国路线的相似度值得标注:都把光互连推进到近封装(华为用自研NPO替代4.8万颗可插拔光模块、功耗降超550千瓦;阿里用开放SNPO解耦供应链),都公开集群上限翻过50万卡,也都选择了"统一内存编址"这个说法。
最后是时间表,它把三家拉到了同一个考场:960DT与V900都指向2027年第一季度,B300已量产在售、下一代爬坡中。那是第一次可以用同一批公开数据做三方实测的窗口——能不能准时交付、软件栈是否就绪、超节点在真实训练任务里能否兑现理论算力,都会在那时见分晓。需要说明的是,昇腾960DT为华为官方数字,B300为媒体整理,V900无绝对值披露,三种信度并存。
五、模型开始改硬件:RSI递归自改进意味着什么比单点提分更值得记录的是RSI(递归自我改进)。大会披露:Qwen3.8-Max在人类完全零参与的情况下,自主搭建训练流程、构造训练数据、设计实验、定位缺陷,持续迭代超过1个月,完成33轮有效迭代(平均约每天一轮),智能指数从40分升到45分,跨进海外顶级模型所在的分数区间,官方称其领先当前所有国产模型。
RSI的外溢比分数更具体——模型同时在供给链的两端动手。软件侧,它先完成了此前从未接触过的平头哥新款GPU的适配:从零搭起Qwen3.8-Flash-Next的推理框架,长文本首token延迟下降47%,每输出token延迟下降60%,日常对话场景单实例吞吐提升96%。硬件侧,它拿一份真实的芯片模块规范,自主运行超过60小时、调用EDA工具超过一万次,把模块物理面积减少42%——在"AI参与设计芯片"的各种说法里,这是一个相对硬的工程结果。
规模这条线没有停。Qwen4正在以全新架构训练中,后续的Qwen4.5、Qwen5计划把总参数扩展到5万亿至10万亿;Qwen3.8-Flash提前开源下一代架构,训练成本下降约90%,推理时几十亿级激活参数就能达到前沿性能,缓存价格压到每百万tokens一毛钱;开源盘子继续扩大,460多个开源模型、累计下载超30亿次、衍生模型超30万个。
意义在于:迭代速度不再受人类工作时长的限制,模型开始改造自己的工具链与硬件链,下一轮能力提升由此多出一个来源。但要带两个限定:起点与评价体系仍是人搭的(预训练基座、评测集、初始框架都是人类资产);45分本身也不是代差,且尚无第三方复现。读的时候,把它当成"能力增长方式变了"的信号,而不是"已经超越"的结论。
六、普通人怎么看:国产算力自主可控
① 从"单芯片"走向"芯片—互连—整机—集群"全栈。 阿里、华为两条线殊途同归,都把光互连推进近封装、都公开50万卡集群上限,国产算力自主可控能力在实质增强,不是PPT叙事。
② 关注"光互连"这个新变量。 SNPO/NPO把光从机柜面板搬到芯片旁边,是下一阶段算力密度突破铜天花板的关键,相关硅光、光模块产业链值得长期跟踪,但区分"开放规范"与"真金白银量产"。
③ 别把PPT算力当现实交付。 V900无绝对值披露、2027Q1才量产;昇腾960同样要等实测。发布会掌声大,不等于产能和软件栈已就绪。
④ 投资看"交付节奏+软件栈成熟度",不是看发布会。 好技术不缺关注,缺的是兑现——能不能准时交货、生态里有多少人真跟进,才是硬指标。
全文总结
9月22日至24日云栖大会,阿里把"芯片—模型—云"全家桶一次性摆上台:平头哥真武V900性能较上代M890翻3倍、216GB显存、2027Q1量产,路线图一年一代每代3倍、810E到V900约9倍,累计出货56万片、国产云端AI加速器份额约16%,但全程未披露绝对算力数字;磐久AL64是全球首款SNPO光互连超节点(单机64卡、无收敛扩展1024卡、把光搬到芯片旁),与AL128(已规模部署)、AL144(全液冷650kW)构成三条演进轴线,单一集群可扩展50万卡。这刚好撞上9月17日华为昇腾960——三方把"一台计算机"推到同一考场:华为960DT(288GB HBM、4096卡、8EFLOPS、51.2万卡)、阿里V900(216GB、2027Q1)、英伟达B300(已量产、288GB HBM3e),都押注近封装光互连、都公开50万卡上限、都讲"统一内存编址",2027Q1是首次可三方实测的窗口。更深层的变化是RSI递归自改进:Qwen3.8-Max零人工完成33轮迭代、智能指数40→45,并自主适配新GPU(首token延迟-47%、吞吐+96%)和改硬件(物理面积-42%),模型开始改造自己的工具链与硬件链;Qwen4/4.5/5计划推至5—10万亿参数、训练成本-90%、每百万token一毛钱。国产算力从单芯片走向全栈自主可控是实打实的趋势,但V900无绝对值、2027Q1才量产,投资要看交付节奏与软件栈成熟度,而非发布会掌声。
免责声明:本文仅为基于公开发布会与新闻的数据梳理与逻辑分析,不构成任何投资建议。股市有风险,投资需谨慎。文中提及企业与数据均来自公开渠道,可能存在延迟或误差,请以公司官方披露为准。
以 上
丨小侠说丨
话题与分类:
主题股票:
主题概念:
声明:遵守相关法律法规,所发内容承担法律责任,倡导理性交流,远离非法证券活动,共建和谐交流环境!
