英伟达Groq 3 LPX机架量产,低延迟推理走向商业化
8月24日,英伟达宣布Groq 3 LPX机架进入全面量产阶段,这桩200亿美元收购案的成果正式商业化落地。单机架搭载256颗Groq 3 LPU芯片,由三星代工,主打AI低延迟推理解码,单机架每秒可处理3400个token,面向大模型的token生成加速,与GPU分工协作。该产品将部署在Nebius数据中心,今年晚些时候正式上线。
这次量产对推理市场影响直接:Groq早期主打”比GPU快数倍”的LPU方案,如今并入英伟达Vera Rubin体系,形成GPU+LPU异构推理机器。推理的低延迟之战,已经从单点芯片竞争转向机架级、数据中心级的整体方案竞争。
全球大模型周调用量首破90万亿Token,算力需求持续爬坡
OpenRouter官方数据,8月17日至23日当周,全球AI大模型总调用量达到93.4万亿Token,环比增长24%,周调用量首次突破90万亿。模型调用量的跳涨带动算力租赁概念走强,A股算力租赁板块出现反弹,佳力图、东易日盛、甘咨询等个股涨停。
调用量数据背后是推理算力需求的真实增长。此前各厂商的降价策略(OpenAI一个月内两次降价)刺激了应用层调用,反过来又推动了对推理算力的采购。
阿里巴巴800亿港元配售落地,募资投向AI
阿里巴巴完成800亿港元配售,创香港市场上市公司增发规模纪录,募资全部投向AI领域。这笔资金的去向将直接影响其云智能和大模型的后续投入。
同日,四川出台19条措施推进算力网建设,明确构建”一区一带两节点”布局,打造三类算力园区,最高支持1000万元智算集群建设。地方层面的算力基建政策密集落地,与头部厂商的资本开支形成共振。
芯片侧:小米玄戒三芯齐发,自研算力产品线成型
8月24日,小米创办人雷军发文解读新一代玄戒自研芯片产品线,共三款芯片:旗舰手机SoC玄戒O3、高带宽AI加速芯片等,五年累计研发经费超210亿元。三芯齐发的背后,是终端厂商向AI算力芯片环节纵向整合,从采购方变为设计方。
计算芯片竞争格局正在从通用GPU单极走向多元:英伟达占据训练与推理主流,Groq LPU侧重低延迟token生成,手机SoC厂商把NPU算力塞进端侧。端侧与云端算力分层布局,是整个行业共同的演进方向。
投融资与行业新动向:从芯片到平台全面加速
AI产业链的资本动作本周集中释放。Hugging Face传出寻求出售的消息,字节跳动发布豆包工作产品整合TRAE与扣子,AI办公与开源社区平台的洗牌在加快。同时,具身智能赛道升温:人形机器人百米跑出9.39秒,小鹏机器人估值达到63亿美元。
从芯片量产、Token调用量、资本配售到地方算力政策,多条线索指向同一个结论:AI基础设施已经从实验室阶段进入规模化商业部署阶段。推理侧的低延迟与成本控制,将成为2026年AI应用竞争的关键变量。
原创文章,作者:小编,如若转载,请注明出处:https://www.yunthe.com/ai-tui-li-xin-pian-liang-chan-yu-quan-qiu-da-mo-xing-zhou/