arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-08-31 至 2026-08-31 共收录 10
2608.28281 2026-08-31 cs.AI 新提交

LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering

LoopArena:将模型作为循环工程运行时控制器的基准测试

Yi Wang, Haopeng Zhang, Chengxiang Huang, Rui Dai, Kaikui Liu, Piotr Koniusz, Xiangxiang Chu

机构 * DreamX Team, Alibaba Group(达摩院团队,阿里巴巴集团) Beijing University of Posts and Telecommunications(北京邮电大学) UNSW Sydney(新南威尔士大学悉尼分校) Data61, CSIRO(联邦科学与工业研究组织数据61研究所)

AI总结 研究推出LoopArena基准,评估模型作为控制器指导编码智能体完成长期任务的能力,发现完整任务上最佳严格成功率为24.69%,推理成本平均降低64.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28113 2026-08-31 cs.CL 新提交

H-Scale: Hessian-Guided Scale Refinement for NVFP4 Sub-Byte LLM Inference

H-Scale:面向NVFP4亚字节大语言模型推理的Hessian引导型尺度优化

Hao Yu, Zheng Li, Dayiheng Liu, Jianwei Zhang

机构 * Qwen Team, Alibaba Inc.(通义千问团队,阿里巴巴集团)

AI总结 针对NVFP4亚字节LLM推理中每组缩放因子优化不足的问题,提出H-Scale方法,利用二阶代理选择硬件合法尺度,改进NVFP4基准并接近BF16参考值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27953 2026-08-31 cs.AI 新提交

The Illusion of $\textit{What If}$: Evaluating the Breakdown of Counterfactual Reasoning in LLMs

《“如果”的错觉:评估大型语言模型中反事实推理的失效》

Yucheng Wang, Yuetian Du, Zhengyi Liu, Rongyu Zhang, Bing Zhao, Boyu Yang, Ming Kong, Lin Qu, Hu Wei, Jie Liu, Qiang Zhu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) City University of Hong Kong(香港城市大学)

AI总结 本研究提出开放域反事实推理基准WhatIfBench及评估框架PRISM,发现前沿LLM在该基准上表现未饱和,存在因果推理缺陷,凸显其反事实推理能力的不足。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27893 2026-08-31 cs.CV 新提交

CommerceVibe: Learning to Design E-Commerce Creatives as Executable Visual Code via Dual-Feedback Reinforcement Learning

CommerceVibe:通过双反馈强化学习学习将电商创意设计为可执行视觉代码

Yajiao Xu, Jin Zhang, Jiangbo Ai, Tao Jiang, Mo Xu, Lina Huang, Chengfu Huo

机构 * Tongji University(同济大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究提出CommerceVibe,将电商创意转化为可执行视觉代码,通过双反馈强化学习优化生成效果,在基准测试中优于仅监督微调的变体及外部模型,实现可控可编辑的规模化电商创意生产。

Comments 20 pages, 13 figures, 12 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27844 2026-08-31 cs.CL 新提交

EvoHarmBench: Breaking Content Moderation with Iterative Human-Like Evasion

EvoHarmBench:通过类人迭代规避突破内容审核

Ruijie Jian, Benlei Cui, Ting Ma, Haidong Ding, Kangwei Liu, Ziwen Xu, Longtao Huang, Hui Xue, Ziqiang Zhu, Junjie Li, Haiwen Hong

机构 * Yuvion Team, Alibaba Group(阿里巴巴集团Yuvion团队) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 该研究提出首个动态对抗评估框架EvoHarmBench,针对5类违规229个语义子簇的5002个样本评估LLM审核模型,发现SOTA模型经12次迭代后规避成功率达80.3%,将推动内容安全评估转向动态模式。

Comments Accepted to the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27529 2026-08-31 cs.CV 新提交

Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction

重新审视长时序流3D重建中的局部上下文

Jiarong Han, Jincheng Xiong, Yuzhou Liu, Linzhe Shi, Changjie Wu, Ning Guo, Mu Xu, Hang Zhang, Ming Qian

机构 * Alibaba Group(阿里巴巴集团)

AI总结 本文提出ABot-Recon流3D重建模型,仅缓存前11帧KV特征,通过局部上下文减少累积漂移,在Oxford Spires数据集上将ATE、RPE-R误差降低约40%,提升了长时序性能。

Comments Project Page: this https URL (https://amap-cvlab.github.io/ABot-Recon-html/), Code: this https URL (https://github.com/amap-cvlab/ABot-Recon)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27477 2026-08-31 cs.AI cs.CV 新提交

Benchmarking General Mobile Assistants in Challenging Real-World Scenarios

在具有挑战性的真实场景中对通用移动助手进行基准测试

Yiqi Zhu, Feiyu Gao, Jiaxing Fan, Jiahui Zeng, Minggang Wu, Chenliang Li, Haiyang Xu, Peng Li, Ming Yan, Yang Liu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

AI总结 该研究提出名为GMA的移动助手基准,涵盖七个应用与300个不同难度任务,评估八个前沿模型发现其性能随任务复杂度提升而下降,还证实合适的智能体控制设计可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27073 2026-08-31 cs.CV cs.RO 版本更新

SpatialCrafter: Single Image World Modeling with Generative 3D Proxies

SpatialCrafter:基于生成式3D代理的单图像世界建模

Chuan Fang, Lingteng Qiu, Yixun Liang, Rui Chen, Kunming Luo, Zhaohua Zheng, Tongyuan Bai, Feipeng Tian, Zilong Dong, Zihan Zhou, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ManyCore Tech Inc.(ManyCore科技公司) Jilin University(吉林大学)

AI总结 SpatialCrafter是解决图像到场景生成问题的两阶段框架,通过3D代理及相关策略提升3D一致性,构建了115K场景的新数据集,性能优于现有方法且鲁棒性强。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15450 2026-08-31 cs.CV 版本更新

Comprehensive Evaluation and Analysis for NSFW Concept Erasure in Text-to-Image Diffusion Models

文本到图像扩散模型中NSFW概念擦除的综合评估与分析

Die Chen, Zhiwen Li, Cen Chen, Yuexiang Xie, Xiaodan Li, Jinyan Ye, Yingda Chen, Yaliang Li

机构 * East China Normal University(东华师范大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对文本到图像扩散模型易生成NSFW内容的问题,开发了全流程概念擦除工具包,首次系统评估相关方法,为其实际应用提供指导并推动内容安全研究。

Comments Duplicate submission. Please cite and refer to arXiv:2502.12527 (https://arxiv.org/abs/2502.12527) for the latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18603 2026-08-31 cs.AI cs.CV 版本更新

Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning

Doc-CoB:通过视觉链式框推理增强文档理解

Ye Mo, Kai Ye, Xianwei Mao, Zirui Shao, Gang Huang, Bo Zhang, Hangdi Xing, Kehan Chen, Huan Zhou, Zixu Yan, Jiajun Bu, Sheng Zhou

机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可感知与智能系统重点实验室,浙江大学) Alibaba Group(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 提出Doc-CoB框架,通过粗到细的布局感知视觉推理,结合多模态大语言模型,逐步聚焦查询相关布局区域,提升文档理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏