近期多模态与视频生成领域迎来密集突破。MiniMax开源其首个多模态模型H3,支持高质量手绘特效与2K视频生成;字节跳动发布Seedance 2.5,可直出影视级AI短片;OpenAI全新模型Astra亦曝光。系列进展标志着AI内容生成从单模态迈向全模态统一理解与生成,大幅降低专业视频创作门槛,冲击传统后期制作范式。
人工智能正深度重构科学研究范式。中国科大构建端到端自主机器催化实验室,首次验证AI"机器科学家"可行性;视觉预训练在科学推理上显著优于纯文本;蛋白质序列生成、电力电网优化等垂直领域取得进展。腾讯混元加码AI for Science人才布局。AI驱动的自主实验与跨学科建模,正加速科学发现从假设驱动向数据-智能融合转型。
具身智能正从实验室演示加速迈向真实场景交付。谷歌DeepMind发布Gemini Robotics 2,以VLA架构实现从指令理解到全身控制;研究新人形机器人移动灵巧操作框架,突破"站桩"瓶颈。产业端,保洁机器人等商用场景落地,World Labs推进物理AI世界构建。技术-产业双轮驱动下,具身智能进入价值兑现关键期。
大模型行业掀起激烈价格战与商业化突围。OpenAI GPT-5.6最高降价80%,DeepSeek通过缓存优化将Token成本压至新低,但Agent高频调用仍导致巨额支出。OpenCode凭借开源策略实现1300万月活,验证开源Coding Agent商业化潜力。同时,本地部署与模型效率优化成为缓解推理成本瓶颈的关键路径,推动AI应用规模化落地。
模型架构与Agent工具链持续迭代。Thinking Machines发布MoE新模型Inkling-Small,以小博大实现性能反超;研究提出Diffusion RL蒸馏采样与生成模型端到端训练新范式。JarvisHub探索画布原生多模态创作Agent,Jina Reranker聚焦垂直领域搜索优化。架构创新与工具精细化,正共同拓展大模型能力边界与应用深度。