Yume-1.5: A Text-Controlled Interactive World Generation Model
Yume-1.5:一种文本控制的交互式世界生成模型
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 Yume-1.5通过文本控制和高效框架生成交互式连续世界,解决实时性能与文本控制能力的瓶颈问题。
高校专区
Yume-1.5:一种文本控制的交互式世界生成模型
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 Yume-1.5通过文本控制和高效框架生成交互式连续世界,解决实时性能与文本控制能力的瓶颈问题。
上下文强凸模拟优化:在不精确解中优化然后预测
机构 * School of Management, Fudan University, Shanghai 200433, China(复旦大学管理学院) ; School of Data Science, Fudan University, Shanghai 200433, China(复旦大学数据科学学院) ; Department of Industrial and Systems Engineering, University of Minnesota, Minneapolis, MN 55455, USA(明尼苏达大学工业与系统工程系)
AI总结 本文提出一种"优化然后预测"方法,通过分析模拟优化算法的不精确性对最优性差距的影响,建立了收敛速率理论并验证了方法的有效性。
OmniBrainBench: 一种全面的多模态基准,用于跨多阶段临床任务的脑影像分析
机构 * Chinese University of Hong Kong(香港中文大学) ; Sun Yat-sen Memorial Hospital, Sun Yat-sen University(中山大学孙逸仙纪念医院) ; Southern Medical University(南方医科大学) ; Zhongshan Hospital, Fudan University(复旦大学中山医院) ; Department of Neurosurgery, Prince of Wales Hospital(威尔士王室医院神经外科部)
AI总结 OmniBrainBench是一个全面的多模态基准,用于评估脑影像分析中MLLMs的多模态理解能力,揭示了其在复杂临床任务中的挑战和与医生的差距。
LIBERO-Plus:视觉-语言-动作模型的深入鲁棒性分析
机构 * Fudan University(复旦大学) ; Tongji University(同济大学) ; Shanghai Innovation Institute(上海创新研究院) ; National University of Singapore(新加坡国立大学)
AI总结 LIBERO-Plus研究了视觉-语言-动作模型在七个维度上的鲁棒性,发现模型对摄像机视角和机器人初始状态等扰动极度敏感,但对语言指令变化不敏感,挑战了高基准分数代表真正能力的假设。
TrackTeller: 基于时间的多模态3D定位用于行为依赖的对象引用
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; Huawei Technologies Ltd.(华为技术有限公司)
AI总结 TrackTeller通过融合LiDAR图像、语言条件解码和时间推理,提升动态3D场景中基于语言的物体定位与跟踪性能。