arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-03-04 至 2026-03-04 共收录 8
2603.02893 2026-03-04 cs.CV

Intrinsic Geometry-Appearance Consistency Optimization for Sparse-View Gaussian Splatting

内在几何-外观一致性优化用于稀疏视角高斯点绘制

Kaiqiang Xiong, Rui Peng, Jiahao Wu, Zhanke Wang, Jie Liang, Xiaoyun Zheng, Feng Gao, Ronggang Wang

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东超高清沉浸媒体技术省重点实验室,深圳大学,北京大学) Peng Cheng Laboratory(鹏城实验室) Migu Culture Technology Co., Ltd(咪咕文化技术有限公司) Alibaba Group(阿里巴巴集团) School of Arts, Peking University(北京大学艺术学院)

AI总结 MVD-HuGaS通过多视角扩散模型实现从单张图像生成自由视角3D人体,结合几何-外观一致性优化提升重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21628 2026-03-04 cs.CL

RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning

RuCL:基于分层评分标准的课程学习用于多模态大语言模型推理

Yukun Chen, Jiaming Li, Longze Chen, Ze Gong, Jingpeng Li, Zhen Qin, Hengyu Chang, Ancheng Xu, Zhihao Yang, Hamid Alinejad-Rokny, Qiang Qu, Bo Zheng, Min Yang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) School of Biomedical Engineering, UNSW Sydney(新南威尔士大学生物医学工程学院)

AI总结 RuCL通过分层评分标准课程学习提升多模态大语言模型的推理能力,实现7.83%的准确率提升。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08646 2026-03-04 cs.LG cs.AI cs.CL stat.ML

Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy

通过推理时间激活能量缓解对齐大语言模型中的过度拒绝

Eric Hanchen Jiang, Weixuan Ou, Run Liu, Shengyuan Pang, Guancheng Wan, Ranjie Duan, Wei Dong, Kai-Wei Chang, XiaoFeng Wang, Ying Nian Wu, Xinfeng Li

机构 * UCLA(加州大学洛杉矶分校) Alibaba Cloud Computing(阿里云计算) SJTU(上海交通大学) Alibaba Group(阿里巴巴集团) NTU(国立科技大学)

AI总结 通过能量景观引导框架,提升大语言模型的安全性并减少虚假拒绝,实验显示在ORB-H基准上合规性显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26127 2026-03-04 cs.CV

EchoGen: Generating Visual Echoes in Any Scene via Feed-Forward Subject-Driven Auto-Regressive Model

EchoGen: 通过前馈主体驱动自回归模型在任意场景中生成视觉回声

Ruixiao Dong, Zhendong Wang, Keli Liu, Li Li, Ying Chen, Kai Li, Daowen Li, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团)

AI总结 EchoGen通过前馈主体驱动自回归模型在任意场景中生成高质量视觉回声,实现高效生成与高保真度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02556 2026-03-04 cs.CV cs.AI cs.CL cs.LG

Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs

通过对比的视角:VLMs中的自改进视觉推理

Zhiyu Pan, Yizheng Wu, Jiashen Hua, Junyi Feng, Shaotian Yan, Bing Deng, Zhiguo Cao, Jieping Ye

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Cloud(阿里云)

AI总结 通过视觉对比提升VLMs的推理能力,提出VC-STaR框架,有效减少推理幻觉并提升多种VLMs的视觉推理性能。

Comments 19 pages, 9 figures, accepted to ICLR 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02216 2026-03-04 cs.LG cs.AI

ATPO: Adaptive Tree Policy Optimization for Multi-Turn Medical Dialogue

ATPO:多轮医疗对话中的自适应树策略优化

Ruike Cao, Shaojie Bai, Fugen Yao, Liang Dong, Jian Xu, Li Xiao

机构 * University of Science and Technology of China(中国科学技术大学) Qwen Applications Business Group, Alibaba Group(阿里云应用业务部) Zhejiang University(浙江大学)

AI总结 ATPO通过自适应树策略优化提升多轮医疗对话中的信息获取效率,有效解决不确定性问题,实验表明其在医疗对话任务中表现优异。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00976 2026-03-04 cs.CV

PreciseCache: Precise Feature Caching for Efficient and High-fidelity Video Generation

PreciseCache: 用于高效且高保真的视频生成的精确特征缓存

Jiangshan Wang, Kang Zhao, Jiayi Guo, Jiayu Wang, Hang Guo, Chenyang Zhu, Xiu Li, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Tsinghua University(清华大学) Tongyi Lab, Alibaba(阿里巴巴通义实验室)

AI总结 PreciseCache通过精确检测和跳过冗余计算,实现视频生成的高效且高质量推理。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18833 2026-03-04 cs.SD cs.CV eess.AS eess.IV

PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation

PrismAudio:分解的思维链与多维奖励用于视频到音频生成

Huadai Liu, Kaicheng Luo, Wen Wang, Qian Chen, Peiwen Sun, Rongjie Huang, Xiangang Li, Jieping Ye, Wei Xue

机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学) Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团) The Chinese University of Hong Kong (CUHK)(香港中文大学)

AI总结 PrismAudio通过分解思维链与多维奖励,解决视频到音频生成中的目标纠缠问题,实现更高质量的生成效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏