AI动态汇总
智元推出机器人世界模型平台GenieEnvisioner
- 核心突破:以视频生成为核心的闭环架构,实现机器人从视觉感知到动作执行的端到端推理与执行。
- 技术架构:包含GE-Base(世界基础模型)、GE-Act(动作解码器)和GE-Sim(动作条件仿真器)三大组件。
- 性能优势:高效的跨本体泛化能力和长时序任务的精确执行能力,例如GE-Act仅需1小时数据即可在新机器人上实现高质量任务执行。
- 开源计划:将开源全部代码、预训练模型和评测工具,并计划扩展更多传感器模态。
智谱上线GLM-4.5V视觉推理模型
- 模型规模:1060亿总参数和120亿激活参数,成为全球100B级效果最佳的开源视觉推理模型。
- 技术架构:视觉编码器、MLP适配器与语言解码器的三模块设计,引入三维旋转位置编码和双三次插值机制。
- 性能表现:在41项公开视觉多模态基准测试中全面达到同级别开源模型的SOTA性能。
- 应用能力:前端复刻功能可生成结构化代码,GUI Agent能力可识别电商页面折扣信息。
字节Seed团队开源VeOmni全模态训练框架
- 核心突破:通过“以模型为中心”的分布式设计理念,解决传统训练方法在工程复杂度、扩展性和效率上的瓶颈。
- 技术优势:将模型组件转化为纯粹的“计算模块”,自动处理通信逻辑,支持高达160K超长上下文序列训练。
- 性能提升:在128卡GPU集群上实现300亿参数MoE模型2800 tokens/sec/GPU的吞吐量,工程耗时降低90%以上。
昆仑万维开源多模态框架Skywork UniPic 2.0
- 核心能力:在单一模型中深度融合图像理解、文本到图像生成和图像编辑三大核心能力。
- 技术架构:采用三模块协同设计,构建从理解到生成再到编辑的端到端闭环。
- 性能突破:以极小参数量实现了越级表现,例如在GenEval生图评估中取得0.89分,超越12B参数的Flux.dev。
企业动态
- 阿里发布通义Wan2.2-I2V-Flash模型:图生视频技术进入“轻快”时代,12倍推理速度跃升,API调用价格降至0.1元/秒。
- 昆仑万维上线音频模型Mureka V7.5,并推MoE-TTS语音合成框架:Mureka V7.5深度建模中文音乐文化特性,MoE-TTS实现自然语言驱动的开放描述系统。
AI行业洞察
- 阿里国际站Accio Agent海外爆火:将传统跨境采购流程压缩至分钟级,通过多智能体协同架构与深度供应链整合重构全球贸易效率。
技术前沿
- FlowReasoner:增强查询级元智能体:通过强化学习与外部执行反馈的协同机制,实现针对单个用户查询的个性化多智能体系统自动生成。
风险提示
- 以上内容基于历史数据完成,在政策、市场环境发生变化时存在失效的风险;历史信息不代表未来。