arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-06-23 至 2026-06-23 共收录 16
2606.23080 2026-06-23 eess.AS cs.SD 新提交

AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation

AudioCALM:面向通用音频生成的连续自回归语言建模

Huadai Liu, Kaicheng Luo, Wen Wang, Qian Chen, Bin Ma, Xiangang Li, Wei Xue

机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学) Tongyi Fun Team, Alibaba Group(阿里云团队,阿里巴巴集团)

AI总结 提出AudioCALM框架,通过连续音频潜变量的自回归预测和不对称模态专家架构,统一语音、声音和音乐生成,在三个任务上达到或超越专用模型性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23064 2026-06-23 eess.AS cs.SD 新提交

STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation

STAR-VAE: 结构化拓扑感知正则化用于音频重建与生成

Huadai Liu, Wen Wang, Kaicheng Luo, Qian Chen, Xiangang Li, Wei Xue

机构 * Hong Kong University of Science(香港科学大学) Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团)

AI总结 针对连续VAE在压缩率、重建保真度和潜在空间拓扑之间的三难困境,提出结构化拓扑感知正则化(STAR),通过增长约束场重塑潜在空间几何,实现音频的高保真重建与生成。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22977 2026-06-23 cs.CL cs.AI 新提交

StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs

StatABench:评估大语言模型统计分析能力的数据集与框架

Youxin Zhu, Yixuan Ding, Peng Lai, Longyue Wang, Bingyi Jing, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Alibaba Group(阿里巴巴集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学)

AI总结 提出StatABench基准,包含404道封闭题和30道开放建模任务,评估LLM在统计分析上的能力,实验显示最佳模型仅达68.6%准确率,揭示工具推理和建模决策等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22906 2026-06-23 cs.SE cs.AI 新提交

From Fragments to Paths: Task-Level Context Recovery for Large Industrial Codebases

从片段到路径:大型工业代码库的任务级上下文恢复

Jiawei He, Weisong Sun, Mengyu Shi, Jie Jia, Tong Bian, Xikai Yang, Dong Sun

机构 * AMAP, Alibaba Group(阿里集团AMAP) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) University of Cambridge(剑桥大学)

AI总结 提出DeepDiscovery方法,通过两阶段定位-推理框架在预算约束下恢复任务级上下文,显著提升大型工业代码库的文件检索和下游软件工程任务性能。

Comments 12 pages, 3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22495 2026-06-23 cs.AI 新提交

Grounded Scaling: Why Agentic AI Needs Deterministic Environments

Grounded Scaling: 为什么代理型AI需要确定性环境

Liang Ding, Xintong Wang

机构 * Alibaba Group(阿里巴巴集团)

AI总结 本文论证环境确定性是影响长链代理任务成功的关键因素,提出确定性-效率界限、验证者-古德哈特下限等理论,并构建供应确定性指数和确定性成熟度模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22462 2026-06-23 cs.LG 新提交

Adaptive Recurrent Message Passing for Test Time Computing on Graphs

自适应递归消息传递用于图上的测试时计算

Junshu Sun, Wanxing Chang, Qingming Huang, Shuhui Wang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院)

AI总结 针对图数据与固定架构不匹配的问题,提出自适应递归图模型AdaR,通过理论推导步依赖作为自适应收敛的充要条件,并利用归一化步信息和梯度监督实现灵活测试时计算,在归纳和直推设置中优于强基线。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22429 2026-06-23 cs.LG 新提交

Enhancing LLMs for Graph Tasks via Graph-aware LoRA Generation

通过图感知的LoRA生成增强LLMs的图任务能力

Junshu Sun, Wanxing Chang, Qingming Huang, Shuhui Wang

机构 * State Key Lab. of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院)

AI总结 提出GaRA模型,通过生成任务特定的低秩权重更新注入全图信息,避免信息损失,在零样本图学习任务上优于基线方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22370 2026-06-23 cs.CV 新提交

Towards Error-Free Long Video Generation

迈向无错误的长视频生成

Shuning Chang, Weihua Chen, Jiasheng Tang, Hao Xu, Zeyu Zhang, Hangjie Yuan, Yu Lu, Ruigang Niu, Fan Wang, Bohan Zhuang, Yi Yang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 提出一种基于扩散模型的长视频生成框架,通过因果注意力、KV缓存和截断修正流技术解决误差累积和属性漂移问题,实现高质量、身份一致的单镜头长视频合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21982 2026-06-23 cs.CV 新提交

CoDMD: Copula-aware Distribution Matching Distillation for Fast Video Generation

CoDMD: 基于Copula感知的分布匹配蒸馏用于快速视频生成

Wenhu Zhang, Kun Cheng, Changyuan Wang, Shiyao Li, Yuechen Zhang, Wenbo Li, Jiajun Zha, Jingyi Zhang, Kang Zhao, Jiaya Jia

机构 * HKUST(香港科技大学) Wan Team, Alibaba Group(阿里巴巴集团万团队) THU(清华大学) CUHK(香港中文大学) XDU(西安电子科技大学)

AI总结 针对视频扩散模型少步蒸馏中分布匹配蒸馏(DMD)的结构缺陷,提出Copula感知的DMD(CoDMD),通过轻量关系正则化器利用分数估计构建样本间和帧间关系矩阵,实现4步生成,速度提升约25倍,VBench得分达84.87。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21906 2026-06-23 cs.CL 新提交

Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding

更深并非总是更好:通过置信层解码缓解对齐税

Xuanming Zhang, Sining Zhoubian, Yuxuan Chen, Tianyi Tang, An Yang, Sean Du, Chujie Zheng, Fei Huang, Dayiheng Liu, Gao Huang, Jingren Zhou

机构 * Qwen Team, Alibaba Inc.(阿里巴巴集团 Qwen 团队) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

AI总结 提出Confident Decoding,一种无需训练的解码策略,通过熵引导的保守反向搜索动态选择最可靠的近最终层,以缓解对齐微调导致的最终层扰动,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21300 2026-06-23 cs.CV 新提交

SCOPE: Scale-Consistent One-Pass Estimation of 3D Geometry

SCOPE:尺度一致的3D几何单遍估计

Zheng Zhang, Lihe Yang, Tianyu Yang, Chaohui Yu, Yixing Lao, Xiaoyang Guo, Biao Gong, Fan Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Alibaba Group(阿里巴巴集团)

AI总结 提出SCOPE方法,通过仿射不变3D点图和三个关键创新(视角不变几何、外观不变学习、频率调制定位),实现从长单目视频序列中高效、一致地估计3D几何,在ScanNet上相对点图误差降低24.2%,时间对齐误差降低34.9%。

Comments SIGGRAPH Conference Papers 2026. 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10757 2026-06-23 cs.CV 版本更新

CodePercept: Code-Grounded Visual STEM Perception for MLLMs

CodePercept: 基于代码的MLLM视觉STEM感知

Tongkun Guan, Zhibo Yang, Jianqiang Wan, Mingkun Yang, Zhengtao Guo, Zijian Hu, Ruilin Luo, Ruize Chen, Songtao Jiang, Peng Wang, Wei Shen, Junyang Lin, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室,人工智能学院,计算机科学学院,上海交通大学) Qwen Team(通义实验室) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学)

AI总结 本文发现多模态大模型在STEM视觉推理中感知能力是瓶颈,提出通过代码作为感知媒介,构建ICC-1M数据集和STEM2Code-Eval基准来增强和评估感知能力。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03666 2026-06-23 cs.LG 版本更新

Provable Filter for Real-world Graph Clustering

可证明的现实世界图聚类滤波器

Xuanting Xie, Erlin Pan, Zhao Kang, Wenyu Chen, Bingheng Li

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Alibaba Group(阿里巴巴集团) Michigan State University(密歇根州立大学)

AI总结 针对现实图结构异质性,提出基于邻居信息识别同/异嗜边并构建高低通滤波器,结合挤压激励模块增强特征,理论支持且实验优于SOTA。

Comments Accepted by IEEE Cybernetics

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01501 2026-06-23 cs.LG cs.AI 版本更新

GAC: Stabilizing Asynchronous RL Training for LLMs via Gradient Alignment Control

GAC: 通过梯度对齐控制稳定大语言模型的异步RL训练

Haofeng Xu, Junwei Su, Yukun Tian, Lansong Diao, Zhengping Qian, Chuan Wu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Alibaba Group(阿里巴巴集团) Southeast University(东南大学)

AI总结 针对异步策略梯度训练中梯度高余弦相似性导致的训练不稳定问题,提出梯度对齐控制(GAC)方法,通过梯度投影调节陈旧对齐方向,恢复稳定训练并匹配同步基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22973 2026-06-23 cs.CV 版本更新

BIFE: Better Interaction, Fewer Errors for Minute-Long Video Generation

BIFE:更好的交互,更少的错误,用于分钟级视频生成

Zeyu Zhang, Jinyuan Mao, Shuning Chang, Yuanyu He, Yizeng Han, Jiasheng Tang, Fan Wang, Bohan Zhuang

机构 * DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) Zhejiang University(浙江大学) Hupan Lab(虎扑实验室)

AI总结 提出BIFE框架,通过语义稀疏KV缓存和块强制训练策略,解决长视频生成中的长程交互保持和误差累积问题,实现稳定连贯的分钟级视频生成,在VDE指标上提升约20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07865 2026-06-23 cs.CV 版本更新

SimAC: A Simple Anti-Customization Method for Protecting Face Privacy against Text-to-Image Synthesis of Diffusion Models

SimAC: 一种针对扩散模型文本到图像合成的简单面部隐私反定制方法

Feifei Wang, Zhentao Tan, Tianyi Wei, Yue Wu, Qidong Huang

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Cloud(阿里云)

AI总结 针对扩散模型定制化技术引发的隐私问题,提出SimAC方法,通过分析时间步选择与频域感知关系及去噪过程不同层特征,设计自适应贪婪搜索和特征优化框架,有效提升身份干扰,保护用户隐私。

Comments Accepted by CVPR2024. Code: https://github.com/somuchtome/SimAC

详情

展开后加载摘要…

URL PDF HTML 收藏