ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning
ReVSeg:通过强化学习激励视频分割的推理链
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; LIGHTSPEED
AI总结 ReVSeg通过强化学习优化视频分割的多步推理链,实现可解释的推理轨迹和先进的性能。
高校专区
ReVSeg:通过强化学习激励视频分割的推理链
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; LIGHTSPEED
AI总结 ReVSeg通过强化学习优化视频分割的多步推理链,实现可解释的推理轨迹和先进的性能。
迈向大型语言模型中幻觉检测与事实验证的统一
机构 * DCST, Tsinghua University(清华大学数据科学研究院) ; Fudan University(复旦大学)
AI总结 本文提出UniFact框架,通过统一评估方法揭示幻觉检测与事实验证的互补性,并证明混合方法在LLM中的优越性。
UAUTrack:迈向统一的多模态反无人机视觉跟踪
机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) ; Fudan University(复旦大学) ; School of Computer Science and Technology(计算机科学与技术学院) ; Zhejiang Normal University(浙江师范大学) ; Department of Mechanical Engineering(机械工程系) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 UAUTrack通过统一多模态框架实现反无人机跟踪,结合文本先验提示策略提升跨模态信息整合效率,取得优异性能与效率平衡。
从检测到关联:学习多目标跟踪的判别性对象嵌入
机构 * East China University of Science and Technology(东华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Sun Yat-sen University(中山大学)
AI总结 FDTA通过引入三个适配器提升多目标跟踪中对象嵌入的判别性,实现更准确的关联性能。
OmniGuard:统一的多模态防护机制与刻意推理
机构 * Fudan University(复旦大学) ; University of California, Davis(加州大学戴维斯分校)
AI总结 OmniGuard通过统一的多模态防护机制与刻意推理能力,有效提升多模态安全防护的鲁棒性和泛化能力。
TempoMaster: 通过下一帧速率预测实现高效的长视频生成
机构 * Fudan University(复旦大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信)
AI总结 TempoMaster通过下一帧速率预测实现高效长视频生成,结合双向注意力和自回归机制,提升视觉和时间质量。
Comments for more information, see https://scottykma.github.io/tempomaster-gitpage/
在野外检测任意3D对象
机构 * OpenDriveLab at Shanghai AI Laboratory(上海人工智能实验室开放驾驶实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Stanford University(斯坦福大学) ; CUHK MMLab(香港大学多模态实验室) ; Tsinghua University(清华大学) ; GAC R&D Center(广汽研发中心)
AI总结 DetAny3D通过结合2D基础模型知识和3D解释器,实现了在任意相机配置下检测任意新物体的3D检测基础模型。