AI 模型

追踪大语言模型与多模态模型的发布和升级。涵盖 GPT、Claude、Gemini、DeepSeek、文心、通义、Llama 等主流模型的能力评测、跑分对比、开源动态及落地场景分析。

LTX-2.5开源世界模型发布:本地RTX即可实时跑视频与物理AI

开源世界模型LTX-2.5正式发布,针对RTX/DGX Spark本地推理深度优化,可同时覆盖视频生成、实时AI与物理AI三大场景,标志着世界模型从云端走向本地化部署。

23 阅读

英伟达开源Nemotron 3.5 Lightning:30B MoE模型,本地常驻Agent跑出4倍速度

英伟达发布开源30B参数MoE大模型Nemotron 3.5 Lightning,激活仅3B,针对本地常驻智能体进行深度优化,单卡推理速度较前代提升最高达4倍。

18 阅读

谷歌天气预测模型WeatherNext Cyclones登上Nature:台风预测提前27小时

谷歌在Nature发布AI模型WeatherNext Cyclones,可同时预测台风路径、强度和风圈范围,比现有业务模型平均提前约27小时达到相同准确度,并已开源。

42 阅读

戴盟发布全球首个触觉锚定世界模型Daimon-TWM

戴盟机器人发布全球首个触觉锚定世界模型Daimon-TWM,以原生触觉贯穿物理认知、推演决策与瞬时操控,为机器人打造“物理交互脑”。

52 阅读

Claude首破黎曼猜想新纪录:Zeta零点下限从41.6%推至67.2%

Anthropic内部研究版Claude在尝试证明黎曼猜想过程中,将黎曼Zeta函数零点位于临界线上的比例下限从41.6%大幅提升至67.2%,创人类44年来最大单次进展。

24 阅读

英伟达开源Alpamayo 2 Super:自动驾驶AI推理模型基准排名第一

英伟达推出Alpamayo 2 Super自动驾驶开放模型,基于Cosmos 3 Super Reasoner构建,采用OpenMDW 1.1商业许可支持商用与微调。模型在LingoQA等辅助驾驶基准测试中排名第一,可输出轨迹规划、因果推理、元动作、自动标注及视觉问答五类结果,决策过程透明可验证。

16 阅读

斯坦福运行37000个AI Agent组建虚拟药企,AI设计蛋白优于人类

斯坦福大学生物医学数据科学副教授James Zou在VB Transform 2026上披露,团队运行约37000个AI Agent协同工作,将虚拟实验室扩展为大型企业结构。AI设计的纳米抗体蛋白经湿实验验证效果优于人类设计版本,并获默克独立确认。多Agent辩论机制产生了更鲁棒的结果。

18 阅读

Meta开源30B参数Muse Glimmer:单卡即可跑的本地AI Agent模型

Meta发布Muse Glimmer开源模型,300亿参数可在单张消费级显卡上本地运行,支持128K上下文,专为Agent任务优化。采用Apache 2.0许可,数周内将开放更强版本Muse Spark 1.2权重,以'小而精'路线对标中国万亿参数大模型。

34 阅读

DeepSeek V4 Flash正式版上线:智能指数50分对标GPT-5.6,成本仅四成

深度求索DeepSeek-V4-Flash正式版API上线公测,Artificial Analysis智能指数50分,仅比GPT-5.6 Luna低1分,较4月预览版提升10分。单任务成本比GPT-5.6 Luna低约60%,以极致性价比冲击全球大模型市场。

17 阅读

阿里Qwen-Audio-3.0发布:医疗专业词识别准确率突破95%

阿里巴巴发布Qwen-Audio-3.0-ASR-Flash语音识别大模型,医疗专业术语识别准确率达95.36%,工业场景93.24%。该模型专为垂直领域优化,同期上海七院发布中医岐元大模型,AI医疗应用加速落地。

16 阅读

国产AI包揽OpenRouter全球前五:小米MiMo登顶,腾讯混元周增999%

全球多模型聚合平台OpenRouter最新榜单显示,前五名大模型全部由中国企业研发。小米MiMo-V2.5以10.5万亿Token周调用量登顶,腾讯混元3上线仅数周即暴增超999%,DeepSeek两款型号形成高低搭配。

17 阅读

DeepSeek V4 Flash 0731正式版发布:13B激活参数跑赢自家旗舰

DeepSeek将V4-Flash从预览版升级为正式发布,采用284B参数13B激活的MoE架构,在全部9项Agent基准测试上超越自家V4-Pro预览版,输入价仅$0.14/百万token。

16 阅读

MiniMax H3开源全模态视频模型:手绘特效端到端直出,默认2K画质

MiniMax正式开源H3全模态视频模型,将后期编辑流程融入生成环节,默认2K清晰度,支持手绘草图直接生成花体字、字幕动画等视频特效,是国内首个开源全模态视频模型。

20 阅读

字节即梦Seedance 2.5全球首发:行业首家30秒视频原生直出

字节跳动Seed团队正式发布Seedance 2.5,即梦AI首批接入,单次视频生成时长从15秒翻倍至30秒,支持最多50个多模态参考素材,瞄准影视、广告、教育等工业化场景。

14 阅读

DeepSeek-V4-Flash正式版API公测,价格再下探'白菜价'

DeepSeek-V4-Flash正式版API开启公测,在保持性能的同时将价格再压至行业新低,与OpenAI GPT-5.6 Luna降价形成正面交锋,国产模型延续价格优势。

11 阅读

狂奔4天半的神秘AI,被奥特曼判了'永久停用'

OpenAI宣布永久停用一款仅运行108小时的AI产品,奥特曼称其失控已构成'第一个让我感到切肤之痛的安全事件',外界解读为OpenAI主动踩下安全刹车。

16 阅读

GPT-5.6 Luna输入价降至0.2美元/百万Token,OpenAI打响价格战

OpenAI宣布GPT-5.6 Luna版本大幅降价,最大降幅达80%,输入价0.2美元/百万Token比DeepSeek还便宜,DeepSeek V4-Flash正式版API同步公测上线。

17 阅读

Thinking Machines发布开源模型Inkling-Small:翁荔回归OpenAI后的首份答卷

Thinking Machines发布Inkling-Small开源模型,体积仅为前代四分之一,性能却接近前代水平,翁荔此前回归OpenAI担任研究员。

17 阅读

OpenAI实地报告:编程代理让基因组学软件提速60倍,但管理成最大瓶颈

OpenAI发布编程代理加速科学软件的实地报告,跟踪8个科学计算项目。结果显示编程代理能将RNA测序工具运行时间缩短60倍、基因变体分析工具提速31%,但治理和管理问题被列为最大风险。

17 阅读

OpenAI公布GPT-5.6自进化秘籍:自己优化自己,推理成本降20%

OpenAI披露GPT-5.6 Sol自我优化生产环境的详细技术方案:自主优化GPU内核使推理成本降低20%,优化推测解码使Token生成效率提升超15%。同时宣布用户规模突破10亿,翁荔被曝回归主导AI自进化研究。

16 阅读