arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-03-05 至 2026-03-05 共收录 4
2603.04022 2026-03-05 cs.CV

Rethinking the Efficiency and Effectiveness of Reinforcement Learning for Radiology Report Generation

重新思考强化学习在放射学报告生成中的效率和有效性

Zilin Lu, Ruifeng Yuan, Weiwei Cao, Wanxing Chang, Zhongyu Wei, Sinuo Wang, Yong Xia, Ling Zhang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Ningbo No.2 Hospital(宁波第二医院) Zhejiang University(浙江大学) Hupan Lab(华研实验室) Fudan University(复旦大学)

AI总结 本文提出DiTPO方法,通过优化诊断F1分数提升放射学报告生成的临床准确性,实现更高效的数据利用和更优的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03825 2026-03-05 cs.CV cs.AI

From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning

从窄视场到全景视觉:基于注意力的冷启动重塑多模态推理

Ruilin Luo, Chufan Shi, Yizhen Zhang, Cheng Yang, Songtao Jiang, Tongkun Guan, Ruizhe Chen, Ruihang Chu, Peng Wang, Mingkun Yang, Yujiu Yang, Junyang Lin, Zhibo Yang

机构 * Tsinghua University(清华大学) University of South California(南加州大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) University of California San Diego(南加州大学圣地亚哥分校) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出AVAR框架,通过视觉锚定与注意力引导提升多模态推理性能,实现7%的平均提升。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03765 2026-03-05 cs.CV

LiDAR Prompted Spatio-Temporal Multi-View Stereo for Autonomous Driving

LiDAR驱动的时空多视角立体摄影用于自动驾驶

Qihao Sun, Jiarun Liu, Ziqian Ni, Jianyun Xu, Tao Xie, Lijun Zhao, Ruifeng Li, Sheng Yang

机构 * Unmanned Vehicle Dept., CaiNiao Inc., Alibaba Group(无人车辆部门, Cainiao Inc.,阿里巴巴集团) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 LiDAR驱动的时空多视角立体摄影框架DriveMVS通过几何提示和深度融合提升自动驾驶的度量精度和跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09879 2026-03-05 cs.CV

TextMaster: A Unified Framework for Realistic Text Editing via Glyph-Style Dual-Control

TextMaster: 一种通过字形-风格双控实现真实文本编辑的统一框架

Zhenyu Yan, Jian Wang, Aoqiang Wang, Yuhan Li, Wenxiang Shang, Ran Lin

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Shanghai Jiao Tong University(上海交通大学)

AI总结 TextMaster通过字形-风格双控机制,实现了高精度、可控的文本编辑,适用于多种场景和图像区域,提升了文本布局的准确性和风格的可控性。

Comments Accepted to ICCV 2025

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 16112-16121

详情

展开后加载摘要…

URL PDF HTML 收藏