用最专业的眼光看待互联网
立即咨询在开源大模型的讨论中,许多人关注模型参数的规模和排行榜的成绩,但在实际应用中,往往会面临不少挑战。当在生产环境中进行多轮长会话时,尤其是在并发量增加的情况下,首字延迟往往会飙升到几个秒,生成速度大幅下降,甚至因为格式解析问题导致工具调用失败。专注于分布式AI训练的团队Prime Intellect,推出了其全新的生产级推理服务平台——Prime Inference,并将底层架构及算子开源回馈社区。
Prime Intellect的重塑不仅仅限于工具开发,他们希望打造一个自我进化的智能代理系统,认为单靠训练是不够的,必须形成一个紧密相连的学习循环:训练模型→提供可靠推理→在现实中生成新体验→洗净数据反馈进行下一轮训练。该系统自推出以来,已在团队内部经过长时间的测试和优化,处理的Token吞吐量接近1万亿,自今年1月起还为多个大客户提供了稳定的支持。
他们的首个公开端点运行在英伟达最新的GB200 NVL72上,GLM-5.3的表现非常出色,在OpenRouter上名列前茅,长会话的工具调用错误率接近零,自上线以来保持了100%的正常运行时间。Prime Inference的解耦架构使得网关和模型集群完全分离,深度集成了NVIDIA Dynamo、vLLM、Mooncake和FlashInfer,并将开发过程中的优化反馈给了开源社区。 南宫28ng娱乐最新官网
为了提升用户体验,Prime团队重点攻克了长上下文Agent推理中的多个关键问题,尤其是在处理140K Token的上下文时,需新添加6K Token的交互内容。在高并发的情况下,系统不仅要应对大量老会话的流量,还需处理新请求的冷启动,传统的处理方式无法满足需求。因此,Prime团队重构了整个处理流程,以保证每个用户每秒100个Token的输出。
在预填充阶段,Prime采用了Prefill/Decode物理分离,即将预填充计算与解码生成的任务拆分至不同的GPU组独立运行,借助NVIDIA Dynamo进行全局路由和分布式编排,确保数据流动的高效。经过这些优化后,系统的延迟显著降低。选择DEP8架构也是经过深思熟虑,利用数据并行和专家并行的组合来进一步提升性能和稳定性。
地址:宣城市此被谷380号