AI 模型
英伟达开源Nemotron 3.5 Lightning:30B MoE模型,本地常驻Agent跑出4倍速度
英伟达发布开源30B参数MoE大模型Nemotron 3.5 Lightning,激活仅3B,针对本地常驻智能体进行深度优化,单卡推理速度较前代提升最高达4倍。
17 阅读作者:新品星球编辑部
8月12日,英伟达正式发布开源大模型Nemotron 3.5 Lightning。这是一款总参数30B、激活参数仅3B的混合专家(MoE)架构模型,主打本地常驻智能体场景,权重与训练细节全部开源。模型在前代基础上将单卡推理速度最高提升至4倍,目标是让开发者无需依赖云端集群,也能在工作站级GPU上稳定跑出可投产的Agent负载。
从架构设计看,Nemotron 3.5 Lightning针对常驻Agent的几个核心痛点做了专门优化:长上下文中的事实保持、工具调用稳定性、长时间运行下的内存占用控制以及多轮对话状态管理。激活参数仅3B的设计,使得在单张RTX 4090级别显卡上就能流畅运行,将本地Agent部署的硬件门槛显著下移。
同一天发布的还有开源世界模型LTX-2.5。该模型针对RTX/DGX Spark本地推理进行专门优化,覆盖视频生成、实时AI与物理AI三大场景。两项发布协同释放出一个明确信号:英伟达正用“开放权重模型+世界模型”的组合,将开发者生态工具与端侧处理能力一并打包,加速推动AI Agent从云端Demo走向本地化、规模化的部署阶段。
英伟达Nemotron开源大模型MoE本地AgentRTX