arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-08-18 至 2026-08-18 共收录 15
2608.16887 2026-08-18 cs.CV 新提交

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

像素空间文本到图像扩散模型训练的实证研究

Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Xiangpeng Yang, Huanqia Cai, Aiming Hao, Yuming Jiang, Peng Gao, Harry Yang, Steven Hoi

机构 * Alibaba Token Hub(阿里巴巴令牌中心) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 本文通过实证研究提出潜空间到像素空间的训练策略,确定关键设计选择,使像素空间文本到图像扩散模型性能媲美或超越潜空间模型,且推理加速3.18至4.75倍,为相关研究提供实用指南。

Comments Z-Image-Pixel & Empirical Insight of Training Pixel-Space Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16554 2026-08-18 cs.CL 新提交

Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning

询问、条件化或弃权:针对缺失前提推理的强化学习

Yongqi Tong, Zhenyu Zhang, Zimi Liu, Kewei Fu, Mingli Song, Haofei Zhang, Junshao Zhang, Hong Zhu, Jiang-Ming Yang, Xin Zhang, Jianshe Li

机构 * Ant International(蚂蚁国际) Zhejiang University(浙江大学) Dingtalk, Alibaba Group(阿里巴巴集团钉钉) Ant Group(蚂蚁集团)

AI总结 本研究提出ACA-RL框架,结合MPB基准,训练模型应对缺失前提的推理任务,可询问、条件化或弃权,提升欠定问题处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16417 2026-08-18 cs.CL 新提交

D2-ScaleAgent: Dual-Dimensional Scaling for Long Document Understanding

D2-ScaleAgent:面向长文档理解的双维度缩放方法

Hao Zhang, Longrong Yang, Lunhao Duan, Ziyang Wang, Qing-Guo Chen, Shanshan Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学)

AI总结 针对现有多模态RAG长文档理解方法缺乏动态计算缩放能力的问题,提出D2-ScaleAgent双维度缩放智能体框架,在相关基准上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16295 2026-08-18 cs.CL 新提交

Executable Code Knowledge: Code as a Native, Validation-Carrying Knowledge Representation for AI Coding Agents

可执行代码知识:作为AI编码智能体原生、带验证的知识表示的代码

Xueping Gao

机构 * Alibaba Cloud(阿里云)

AI总结 该研究提出可执行代码知识(ECK)及其单元ECKU,构建Python原型验证其在编码智能体任务中的效果,支持源绑定、验证等功能,为AI编码智能体提供了混合架构方案。

Comments 11 pages. Submitted to AgenticDev 2026, co-located with ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15522 2026-08-18 cs.CV 新提交

Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention

基于同步感知跨模态稀疏注意力的高效视听生成

Shengchuan Gao, Teng Hu, Bohao Feng, Luchen Li, Wenqiang Wang, Hongqian Deng, Ran Yi

机构 * Alibaba Group(阿里巴巴集团) Alibaba Cloud Computing(阿里巴巴云计算) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出同步感知加速框架,通过受保护的稀疏注意力策略在保留视听生成质量与同步性的同时提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15291 2026-08-18 cs.AI 新提交

ReasonCast: Agentic Demand Forecasting with Selective Semantic Reasoning

ReasonCast:基于选择性语义推理的智能体需求预测

Ziyue Yang, Chaolin Xu, Yijing Wang, Tiankai Gu, Hui Yang, Yanhong Lin, Kaiyuan Liu, Fei Xiao

机构 * Taobao and Tmall Group, Alibaba Group(阿里巴巴集团淘宝天猫集团)

AI总结 ReasonCast是结构化语义干预框架,通过选择性语义推理结合多类信息,在三类场景降低WMAPE,且可避免稳定期无差别干预的负面影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14652 2026-08-18 cs.LG cs.AI cs.CV 新提交

Pushing the Limits of High-Resolution Weather Forecasting through Data Scaling

通过数据缩放推动高分辨率天气预报的极限

Yang Zhao, Peisong Niu, Tian Zhou, Ziqing Ma, Guanlong Ma, Rong Jin, Huiling Yuan, Liang Sun

机构 * State Key Laboratory of Severe Weather Meteorological Science and Technology, Nanjing University(南京大学灾害性天气气象科技国家重点实验室) School of Atmospheric Science, Nanjing University(南京大学大气科学学院) Ant Healthcare, Ant Group(蚂蚁集团蚂蚁医疗) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院)

AI总结 该研究针对高分辨率天气预报的 data bottleneck,提出BaguanHR框架,通过变量级超分辨率合成高分辨率数据,使预报性能超越现有方法,且数据量与预报误差呈幂律关系。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11079 2026-08-18 cs.AI 版本更新

SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure

SkillZip:通过发现可重用结构实现自进化智能体的免评估技能压缩

Xiaofan Bai, Hongqiang Lin, Chao Liu, Yantao Zhang, Xuan Jin, Xipeng Cao, Yuhong Li

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Duke University(杜克大学)

AI总结 SkillZip 是一种免评估的自进化智能体技能压缩方法,通过提炼重复规则与动作序列实现高效压缩,在性能、泛化性及成本上优于评估引导压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03025 2026-08-18 cs.AI 版本更新

DiffImaginE: Imagine to Verify Entity Types with Diffusion

DiffImaginE:通过想象验证实体类型

Feng Zhang, Feiyu Han, Rongxin Yang, Yang Liu, Yancheng Chen, Rui Wang, Yingguang Yang, Tian Xueyun, Chongyang Zhang, Hao Zheng, Xu Kefu, Congjing Ran, Fuhai Chen, Bin Chong

机构 * Fuzhou University(福州大学) Chinese Academy of Sciences(中国科学院) Peking University(北京大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学) Fullive Innovation (Beijing) AI Technology Co., Ltd.(福莱创新(北京)人工智能科技有限公司) Baidu(百度) Wuhan University(武汉大学)

AI总结 DiffImaginE将多模态命名实体识别的类型验证建模为条件潜在扩散推理,在Twitter-2015和Twitter-2017数据集上,相比确定性对照模型取得了一致的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27366 2026-08-18 cs.CL 版本更新

BridgeAlign: Bridging Preference Alignment for Humanities and Social Sciences

BridgeAlign:面向人文社科的偏好对齐框架

Ru Peng, Haokai Xu, Xijun Gu, Tianyu Zhao, Zhiting Fan, Yawen Zeng, Yihong Zhuang, Jinyang Zhang, Kexin Yang, Jian Wu, Hao Chen, Junyang Lin, Dayiheng Liu, Junbo Zhao

机构 * Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

AI总结 该研究针对人文社科领域的偏好对齐需求,提出BridgeAlign框架,经21万+合成偏好样本对齐后,使Qwen3-8B在17个基准测试中优于11个强基线,且人工偏好与知识能力无权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26632 2026-08-18 cs.LG 版本更新

RT-Lynx: Putting GEMM Sparsity in the Right Place for Diffusion Models

RT-Lynx:以正确方式将GEMM稀疏性应用于扩散模型

Xing Cong, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Chenhao Xie

机构 * Alibaba Group(阿里巴巴集团) Independent Researcher(独立研究者)

AI总结 针对扩散模型推理成本高的问题,提出将N:M半结构化稀疏性从权重转移到激活,结合误差补偿技术,实现线性层平均1.55倍加速且保持生成质量。

Comments 33 pages, 18 figures, Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11439 2026-08-18 cs.LG cs.AI 版本更新

Retrofit: Continual Learning with Controlled Forgetting for Binary Security Detection and Analysis

Retrofit: 二进制安全检测与分析中的受控遗忘持续学习

Yiling He, Junchi Lei, Hongyu She, Shuo Shao, Xinran Zheng, Yiping Liu, Zhan Qin, Lorenzo Cavallaro

机构 * University College London(伦敦大学学院) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 Retrofit通过受控遗忘机制在持续学习中平衡知识保留与适应性,无需历史数据,在恶意软件检测和二进制摘要任务中提升了性能和泛化能力。

Comments Accepted by USENIX Security 2026. The artifact received all three badges

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13964 2026-08-18 cs.CL 版本更新

HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam

HLE-Verified: 人类最后考试的系统验证与结构化修订

Weiqi Zhai, Zhihai Wang, Jinghang Wang, Boyu Yang, Xiaogang Li, Xander Xu, Bohan Wang, Peng Wang, Xingzhe Wu, Anfeng Li, Qiyuan Feng, Yuhao Zhou, Taolin Han, Wenjie Luo, Yiyuan Li, Xiang Zheng, Yaxuan Wang, Ruixiang Luo, Guojie Lin, Peiyao Xiao, Chengliang Xu, Ben Wang, Zeyu Wang, Zichao Chen, Jianan Ye, Yijie Hu, Jialong Chen, Zongwen Shen, Yuliang Xu, An Yang, Bowen Yu, Dayiheng Liu, Junyang Lin, Hu Wei, Que Shen, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团)

AI总结 HLE-Verified通过系统验证和结构化修订,减少噪声并提高模型评估的准确性。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08261 2026-08-18 cs.LG cs.GT 版本更新

PRO-Bid: Pareto-Prioritized Regret Optimization for Constraint-Aware Generative Auto-Bidding

基于帕累托优先的约束感知生成自动出价

Binglin Wu, Yingyi Zhang, Xianneng Li, Ruyue Deng, Chuan Yue, Weiru Zhang, Xiaoyi Zeng

机构 * Dalian University of Technology Dalian China Dalian University of Technology \& City University of Hong Kong Dalian China Alibaba International Digital Commerce Group Hangzhou China Dalian University of Technology Dalian University of Technology \& City University of Hong Kong Alibaba International Digital Commerce Group

AI总结 PRO-Bid通过约束解耦帕累托表示和反事实遗憾优化机制,提升自动出价在约束下的性能和价值获取能力。

Comments Accepted to CIKM2026 Full Research Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09209 2026-08-18 cs.GR cs.CV cs.SD 版本更新

EchoMask: Speech-Queried Attention-based Mask Modeling for Holistic Co-Speech Motion Generation

EchoMask:用于整体同步语音动作生成的基于语音查询注意力的掩码建模

Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Jianqiang Ren, Liefeng Bo, Zhigang Tu

机构 * Wuhan University(武汉大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

AI总结 本研究提出EchoMask框架,通过MAM和SQA实现动作对齐的语音特征引导的掩码建模,生成高质量同步语音动作,性能优于现有最先进方法。

Comments 10 pages, 12 figures. Accepted to ACM Multimedia 2025. Project page: https://xiangyuezhang.com/EchoMask/; code and pretrained models: https://github.com/Xiangyue-Zhang/EchoMask

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (MM '25), 2025, pp. 10827-10836

详情

展开后加载摘要…

URL PDF HTML 收藏