arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-07-07 至 2026-07-07 共收录 9
2607.05396 2026-07-07 cs.CV cs.AI cs.LG cs.RO 新提交

From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model

从固定相机到自由相机:无需标定的视图鲁棒视觉-语言-动作模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Shijian Lu, Gongjie Zhang, Ran Xu

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团)

AI总结 针对真实机器人部署中相机位姿变动问题,提出CamVLA模型,解耦操控控制与相机几何,实现无标定视图鲁棒的机器人任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05242 2026-07-07 cs.LG cs.AI cs.IR 新提交

CanniUplift: A Holistic Framework for Mitigating Seller and Incentive Cannibalization in E-commerce Uplift Modeling

CanniUplift:缓解电商增益建模中商家蚕食与激励蚕食的整体框架

Zuwang He, Shihao Shu, Yuli Qu, Hanyu Gao, Ziliang Zhang, Diwei Chen, Xiangda Yan, Buyu Gao, Tanchao Zhu, Yumeng Li, Junxiong Zhu

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝及天猫集团)

AI总结 针对传统电商增益模型违反SUTVA的两类蚕食问题,提出含PGA、RDD和Treat-Attention的统一框架,实验与线上部署均验证其可显著提升平台增量GMV与ROI。

Comments Accepted to KDD 2026, 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04636 2026-07-07 cs.CV 新提交

Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis

通过场景感知文档合成增强关键信息提取中的大型多模态模型

Zhipeng Xu, Zulong Chen, Qing Liu, Junhao Ji, Jinxin Hu, Yipeng Yu, Jianqiang Wan, Jun Tang, Zhao Li

机构 * Alibaba Group(阿里巴巴集团) Qwen Team, Alibaba Group(阿里巴巴集团之通义千问团队) Taobao and Tmall Group, Alibaba(阿里巴巴淘宝和天猫集团) Zhejiang University(浙江大学)

AI总结 研究关键信息提取难题,提出场景感知文档合成框架SAYRE,利用示例文档生成训练数据,引入错误驱动生成,提升Qwen3-VL骨干性能,证明该方法是改进多模态KIE的有效数据中心方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04167 2026-07-07 cs.LG 新提交

Geometry of Ordinal Representations in Language Models

语言模型中序数表示的几何结构

Saksham Bassi, Sharvi Tomar

机构 * Gemma Team(杰玛团队) Qwen Team(文生团队)

AI总结 研究在多个语言模型中测试序数任务,发现当序数变量可从令牌身份局部计算时会出现具有位置细胞特征平铺的一维流形,几何计算与架构有关,激活修补证实流形子空间集中任务相关信息。

Journal ref Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03862 2026-07-07 cs.CV 新提交

Ghosts Beneath Textures: Texture-Relation Cues for Cross-Paradigm AI-Generated Image Detection

纹理之下的幽灵:跨范式人工智能生成图像检测的纹理关系线索

Haoyu Wang, Yiming Qin, Zhongjie Ba, Ziping Dong, Jishen Zeng, Peng Cheng, Kui Ren

机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Alibaba Group(阿里巴巴集团)

AI总结 研究跨范式人工智能生成图像检测问题,构建基准ConImageGen,发现现有检测器跨范式泛化失败。识别跨范式取证线索,提出DTS-Det框架利用纹理关系检测,实验验证其有效性,性能达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02914 2026-07-07 cs.AI 新提交

Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models

Oyster-II:大语言模型中用于建设性安全对齐的强化学习

Jiyang Guan, Yong Xie, Jun Chen, Jiexi Liu, Zipeng Ye, Defeng Li, Jiayu Shen, Jialing Tao, Hui Xue

机构 * Alibaba AAIG(阿里巴巴人工智能全球研究院)

AI总结 研究大语言模型安全等问题,指出传统策略不足。基于Oyster-I范式,提出Oyster-II框架,采用强化学习结合零强化学习范式,在多基准测试中安全维度表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01793 2026-07-07 cs.AI 新提交

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

大规模安全测试LLM智能体:从风险发现到基于证据的验证

Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Zhuoer Xu, Xiaohu Du, Jianan Ma, Zixing Chen, Xingjun Ma, Yunhao Chen, Xinhao Deng

机构 * AntGroup(蚂蚁集团) Zhejiang University(浙江大学) Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Hunan Institute of Advanced Technology(湖南先进技术研究院) Deakin University(迪肯大学)

AI总结 提出Vera框架,通过文献驱动的风险发现、组合生成可执行安全用例和自适应执行与证据验证三阶段流水线,实现端到端自动化安全测试,在四个生产级智能体框架上发现严重漏洞,平均攻击成功率93.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31672 2026-07-07 cs.CV cs.AI 新提交

WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models

WorldRoamBench:交互式世界模型长时稳定性的开放世界基准

Ting-Bing Xu, Jiacheng Sui, Zhe Gao, Kewei Shi, Wenjin Yang, Zhicheng Liu, Zhaoxu Sun, Mingchao Sun, Hongyu Pan, Fan Jiang, Mu Xu, Qi Fan, Yang Gao, Yong Li, Baoquan Chen

机构 * AMAP CV Lab, Alibaba Group(阿里巴巴集团AMAP CV实验室) Nanjing University(南京大学) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 提出WorldRoamBench基准,从动作、视觉、物理和记忆四维度评估交互式世界模型的长时稳定性,包含600+测试用例,揭示现有模型在所有维度均不理想。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26092 2026-07-07 cs.CV 新提交

TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy

TryOnCrafter: 通过可渲染的4D试穿代理释放相机轨迹以实现逼真的视频虚拟试穿

Hao Sun, Hao Yan, Mengting Chen, Quanjian Song, Yu Li, Juan Cao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Sheng Tang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Xiamen University(厦门大学) Alibaba Group(阿里巴巴集团)

AI总结 提出TryOnCrafter,首个基于DiT的统一框架,通过可渲染4D试穿代理解耦人体与环境,实现相机可控的视频虚拟试穿,支持任意视角合成和下游应用。

Comments Project Page: https://sunhao242.github.io/TryOnCrafter_web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏