随着大模型训练与推理需求持续增长,全球人工智能基础设施建设正在加速。从中国到中东、北美及东南亚,大量GPU资源被部署至数据中心,数万亿资金涌入AI基础设施建设,智算产业也由早期的基础设施建设阶段,逐步进入更加注重效率、稳定性与商业回报的运营阶段。
在这一变化过程中,传统按照GPU卡时、节点或机柜进行计费的“裸金属租赁”模式,正面临新的挑战。对于智算中心而言,衡量其经营能力的核心指标,不再只是拥有多少GPU,而是——单位时间能够稳定产出多少Token、每百万Token的综合成本是多少,以及每张GPU能够创造多少实际价值。
基于这一行业趋势,沨呵智慧科技(上海)有限公司提出“Token效率运营模型”理念,通过AI Infra所含九层技术栈、精益智算方**与信通院权威测试背书,推动智算中心由“低利润裸金属租赁”向“高价值Tokens工厂”转型。
从算力裸金属设备交付走向Token高效产能运营
沨呵智慧自2021年在上海张江科学城运营起,公司聚焦AI Infra安全及效率解决方案,核心团队成员拥有国际IT厂商20年从业背景,在技术落地、渠道建设及大型项目交付等方面积累了长期经验。
沨呵智慧认为,GPU是人工智能基础设施中的生产设备,Token则是设备最终生产出的数字化产品。客户真正需要的并非GPU设备本身,而是模型训练结果、推理服务能力以及稳定可持续的Token产出。
基于这一判断,沨呵智慧在 2023 年提出“精益智算”建设标准,希望通过资源调度、运行环境优化、模型部署、推理加速和自动化运维等技术手段,减少GPU空转、排队、显存碎片及低效运行等问题,提升智算中心的有效产出能力。
“智算中心未来需要解决的不只是资源建设问题,更是产能经营问题。对客户而言,他们需要的是训练结果和推理能力;对智算中心而言,真正能够创造商业价值的是GPU最终产出的Token。”
——沨呵智慧AI 工程中心
核心方**:构建TEF、TFI与TFOM经营体系
为推动智算中心运营指标标准化,沨呵智慧构建了由TEF、TFI和TFOM组成的Token工厂经营方**,将技术性能、服务质量与财务回报纳入统一评价体系。
其中,TEF,即Token效率因子,主要衡量GPU实际用于Token生产的有效时间占总运行时间的比例。根据公司项目实践,大部分智算中心的GPU有效产出比例仅为理论产能的20%至35%,大量算力消耗在任务等待、调度间隙、显存碎片以及低效批处理等环节。通过精益调度及全链路优化,公司提出将TEF从30%提升至65%以上的运营目标。
TFI,即Token工厂指数,在TEF基础上进一步引入服务可用性和Token售出率,通过“TEF×服务可用性×产能售出率”的方式,衡量智算中心整体产能商业化水平。
TFOM,即Token工厂经营模型,进一步将TPS(每秒Token数)、延迟(首Token/单Token)、TEF(Token效率因子)、GPU利用率及TCO(总拥有成本)等技术指标,与营收、客户体验、毛利率、资产周转率及投资回报率等财务指标进行对应,帮助投资方、智算中心运营方和企业管理者更加直观地评估项目经营质量。
以1000张B200 GPU组成的集群为例,按照公司的测算方式,如果TEF由30%提升至65%,其有效产出增量可相当于增加约1167张GPU——不用采购,不用等货,不用额外建机房,直接省下数亿元资本支出(CapEx)。
技术护城河:九层全栈自研架构打通智算中心技术链路
在技术层面,沨呵智慧精益智算产品覆盖了AI基础设施全生命周期的九层技术栈。
该架构从物理基础设施层开始,依次覆盖硬件驱动层、系统运行时层、资源调度层、存储数据层、训练框架层、模型管理层、推理服务层和应用服务层,形成从机房制冷、供电管理、GPU驱动适配,到模型部署、推理引擎、API网关及多模态调度服务交付的完整技术链路。
与单一聚焦资源管理、模型训练或推理服务的技术方案不同,覆盖九层架构强调各层之间的协同联动。上层调度能感知底层硬件状态,底层故障能被上层自动消化,推理层的 KV-Cache 策略与存储层的数据预取联动,训练框架的梯度聚合与通信层 NCCL 优化打通。整条链路没有断点。例如,资源调度系统可以感知底层硬件状态,并根据故障情况自动进行任务迁移;推理层的KV-Cache优化可以与存储层的数据预取机制协同;训练框架中的梯度聚合能力也可以与底层通信优化机制联动。
依托Ti-X调度引擎、ADS自动部署系统、KV-Cache优化引擎及全链路自动化运维能力,沨呵智慧形成了从智算中心设计、部署、调优到持续运营的完整服务体系,并具备单一集群管理超过10000张GPU的技术能力。
权威背书:信通院AISPerf测试验证系统服务能力
2026年5月,沨呵智慧接受了中国信息通信研究院云计算与大数据研究所相关测试。测试基于AISPerf人工智能系统性能测试平台开展,覆盖软硬件配置验证、软件框架功能、客户端服务能力、监控仪表盘功能及大模型推理性能等多个维度。
在大模型推理性能测试中,测试采用Qwen/DeepSeek-R1-Distill-Qwen-32B模型,在满载并发场景下完成14400次请求——失败数:0,测试数据显示,系统在满负载下依然保持了高吞吐输出,首 Token 平均延迟控制在合理区间,单 Token 生成延迟仅约 12 毫秒。
根据公司在实际客户项目中的运行数据,经过九层架构优化后,相关推理系统吞吐量提升超过200%,首Token延迟降低约40%。在训练及集群运营场景中,整体资源利用率提升30%以上,硬件故障率降低50%,人工运维成本减少70%。
这些测试与项目数据,为大型智算中心持续运行、资源调度、模型训练及高并发推理服务提供了量化参考,也为公司参与大型企业、政府及央国企智算项目建设提供了技术能力支撑。
建设覆盖国内与海外市场的服务体系
沨呵智慧主要面向大型智算中心业主提供全生命周期服务,包括前期TCO测算、架构规划和设备选型,中期九层技术栈部署、集群联调及性能优化,以及后期SLA保障、效率监控和持续运营优化。
2026年5月,公司在海南三亚崖州湾国家级科技城落地了国际业务出口及亚太区服务中心,计划面向东南亚、中东、北美等人工智能基础设施需求增长较快的市场输出精益智算能力。
同期,沨呵智慧与紫光智算签订海外AIDC战略合作,双方将结合全球渠道资源、智算基础设施建设能力及全栈运营技术,共同拓展海外人工智能数据中心市场。
随着AI Infra产业由规模建设进入精细化运营阶段,智算中心的竞争重点正在由GPU数量转向单位算力的实际产出能力。如何提升Token产量、降低单位Token成本、保障服务稳定性,并形成可持续的商业回报,将成为行业下一阶段的重要课题。
沨呵智慧表示,未来将继续完善九层技术栈的技术挖掘和Token工厂经营效率模型,推动技术指标与经营指标的无缝融合,让每一张GPU释放极致Token产出,让智算中心从算力资源中心升级为可持续运营的Token数字化产能平台。