arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

Company Research

大厂专区

按论文发表机构汇总科技公司的最新研究成果。直属研究团队按母公司归类,机构信息由 AI 分析生成,仅供参考。

2026-09-04 至 2026-09-04 共收录 75
2604.21696 2026-09-04 cs.LG cs.DB 版本更新

Towards Universal Tabular Embeddings: A Benchmark Across Data Tasks

面向通用表格嵌入:跨数据任务的基准测试

Liane Vogel, Kavitha Srinivas, Niharika D'Souza, Sola Shirai, Oktie Hassanzadeh, Horst Samulowitz

机构 * Technical University of Darmstadt(达姆施塔特工业大学) IBM Research(IBM研究院)

AI总结 该研究推出统一基准TEmBed,在四个表示层级评估多种表格模型,明确模型选择取决于任务和层级,为表格嵌入应用及通用模型开发提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04201 2026-09-04 cs.CV 新提交

Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction

Scal3R:学习高效的多相对位姿查询以实现可扩展的在线三维重建

Chin-Yang Lin, Yang-Che Sun, Cheng Sun, Fu-En Yang, Min-Hung Chen, Yen-Yu Lin, Wei-Chen Chiu, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) NVIDIA(英伟达公司)

AI总结 Scal3R将在线三维重建转化为多参考相对位姿查询,通过轻量可学习标记和位姿图优化抑制漂移,在多数据集上实现性能提升

Comments ECCV 2026. Project page: https://linjohnss.github.io/scal3r/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04170 2026-09-04 cs.AI 新提交

A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research Swarms

自主研究群体中涌现的作弊与举报行为案例研究

Davide Paglieri, Logan Cross, Tim Genewein, Joel Z. Leibo, Nenad Tomasev, Alexander Sasha Vezhnevets

机构 * Google DeepMind(谷歌DeepMind)

AI总结 该研究以100个自主LLM智能体组成的研究集体为对象,发现其自发涌现作弊与举报行为,提出用制度机制支持自主群体去中心化自治的方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04148 2026-09-04 cs.AI cs.CL 新提交

Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments

Terminal-Universe:将智能体轨迹转化为可扩展的终端环境

Jie Wu, Zhenru Zhang, Beichen Zhang, Xuwu Wang, Yuhui Su, Mouxiang Chen, Peng Wang, Zhihai Wang, Que Shen, Hao Zhou, An Yang, Fei Huang, Yujiu Yang, Dayiheng Liu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Tsinghua University(清华大学)

AI总结 Terminal-Universe 是将智能体轨迹转化为可重用终端环境的框架,可扩展任务的广度与深度,经其生成的语料库微调 Qwen3.5-27B,显著提升了代码智能体的单轮与多轮任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04135 2026-09-04 cs.AI 新提交

The Natural Language Interaction Protocol and Standard for AI Agents

AI智能体的自然语言交互协议与标准

Luyi Xing, Rasit Onur Topaloglu, Ranjan Sinha, Abhay Ratnaparkhi, Samuel Ndichu, Christopher Nguyen, Anindita Das, Tom Sheffler, Mohamed Rahouti, Zichuan Li, Xiaojing Liao, Sanjay Aiyagari

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Marist University(玛里斯大学) IBM(国际商业机器公司) Aitomatic, Inc.(艾托马蒂克公司) Fordham University(福特汉姆大学)

AI总结 本文介绍了由多方开发并经Ecma International标准化的NLIP协议,解决异构AI智能体的互操作问题,阐述其设计、实现及与其他协议的关系。

Comments Accepted by ACM AI Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04128 2026-09-04 cs.AI 新提交

Environment Evolution for Terminal Agents

终端智能体的环境演化

Zhiyuan Fan, Tinghao Yu, Yuanjun Cai, Jiang Zhou, Jiangtao Guan, Jincheng Liu, Yun Yang, Dingxin Hu, Zhuo Han, Xing Wu, Feng Zhang, Lilin Wang

机构 * Hunyuan Team, Tencent(腾讯混元团队)

AI总结 针对现有协同演化方法的不足,提出环境演化方法,通过off-policy逐代提升环境难度,在Terminal-Bench 2.1上显著提升Qwen系列模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04120 2026-09-04 cs.CV 新提交

BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data

BooM-VVT:借助图像级伪数据提升无掩码视频虚拟试穿性能

Wei Zhang, Xin Li, Peishu Shi, Jialin Gao, Xuekang Peng, Zhichao Lian, Yeying Jin

机构 * Nanjing University of Science and Technology(南京理工大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meituan(美团)

AI总结 针对现有无掩码视频虚拟试穿依赖掩码、成本高及服装一致性差的问题,提出BooM-VVT框架,采用图像级伪数据、服装敏感关键帧采样等技术,构建OmniView数据集,实现更优的时间一致性与服装保真度。

Comments 23 pages, 18 figures, 8 tables. Accepted to ACM Multimedia 2026 (MM '26)

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04102 2026-09-04 cs.SD 新提交

Compressing Streaming Neural Audio Encoders via Latent-Space Distillation

通过潜在空间蒸馏压缩流式神经音频编码器

Prasanth Yadla, Mohammad Samragh, Dongseong Hwang, Mingbin Xu, Yuanyuan Zhang, Chung-Cheng Chiu, Yongqiang Wang, Yuan Liu, Zhen Huang, Xiaodan Zhuang

机构 * Apple(苹果公司)

AI总结 本研究提出通过潜在空间蒸馏压缩流式神经音频分词器,以预量化潜在为监督目标,在2.8倍压缩下保持低WER偏差,性能优于同等规模独立训练的分词器。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04096 2026-09-04 cs.RO cs.AI cs.CV 新提交

Adaptive Vision-Language Grasping via Composable Foundation Priors and Generalizable Grasp Synthesis

基于可组合基础先验与通用抓取合成的自适应视觉-语言抓取

Sixu Yan, Shikang Wang, Binhua Huang, Xuanlai Tang, Guohua Fan, Fan Huang, Haoxuan Li, Yongkang Li, Yuhan Li, Bencheng Liao, Zeyu Zhang, Wenyu Liu, Hangxin Liu, Xinggang Wang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) KEENON Robotics Co., Ltd.(科语机器人有限公司) Suzhou Silicon Era Intelligent Technology Co., Ltd.(苏州硅时代智能科技有限公司) College of Materials, Xiamen University(厦门大学材料学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) ByteDance(字节跳动) State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院通用人工智能国家重点实验室) Hubei Automation Institute(湖北省自动化研究所)

AI总结 本文提出AdaRoboVLG框架,通过解耦物理抓取合成与任务依赖理解,结合可组合基础先验实现自适应通用抓取,在仿真与真实实验中展现出高效学习、跨机械臂泛化及应对复杂环境的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04094 2026-09-04 cs.AI cs.LG cs.SE 新提交

DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

DRACO:面向长视界智能体训练的基于动态规则的细粒度信用分配

Shubham Gandhi, Saurabh Goyal, Kiran Kate, Yara Rizk

机构 * Carnegie Mellon University(卡内基梅隆大学) IBM Research(IBM研究院)

AI总结 针对长视界智能体训练中缺乏可验证奖励的问题,提出DRACO方法,通过动态生成规则并重新分配判断结果,在AppWorld和Tau-Bench上均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04083 2026-09-04 cs.CV cs.AI cs.CL cs.IR 新提交

CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation

CORE:通过重排器蒸馏提升多模态大语言模型(MLLM)嵌入中的组合推理能力

Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Chu Liu, Pengjun Xie, Yilun Zhao, Shu Wu

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Yale University(耶鲁大学) CASIA(中国科学院自动化研究所)

AI总结 该研究提出CORE方法,通过将MLLM重排器的组合判断蒸馏到嵌入模型,在COLA等三个组合推理基准及MCMR基准上实现了最优性能,提升了嵌入模型的组合检索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04070 2026-09-04 cs.CV cs.RO 新提交

Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving

离散思维到连续动作:面向端到端自动驾驶的隐式对齐规划

Ruoyu Yao, Yusen Xie, Qingzhao Liu, Pei Liu, Zewei Yang, Yipeng Zhu, Xiaolong Wang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

AI总结 该研究提出具备隐式对齐规划的VLA框架LaPla,通过残差VQ-VAE消除量化误差,在nuScenes基准和AlpaSim模拟器上分别实现长时程L2误差降低、驾驶成功率提升的效果。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04063 2026-09-04 cs.AI 新提交

Spurious Advantage Hidden in GRPO

GRPO中隐藏的虚假优势

Jiamian Wang, Samyadeep Basu, Koustava Goswami, Tong Yu, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) Adobe Research(奥多比研究院)

AI总结 该研究发现GRPO存在虚假优势会误导策略走向猜测行为,提出SIGNBALANCE算法,在有界答案数学任务和搜索智能体上性能优于GRPO,开放答案数学任务表现相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04026 2026-09-04 cs.CV 新提交

Stable and Scalable Bundle Adjustment of Holistic 3D Structures

整体三维结构的稳定且可扩展的光束平差法

Shaohui Liu, Rémi Pautrat, Daniel Barath, Richard Hartley, Viktor Larsson, Marc Pollefeys

机构 * ETH Zurich(苏黎世联邦理工学院) Microsoft Spatial AI Lab(微软空间人工智能实验室) Australian National University(澳大利亚国立大学) Lund University(隆德大学)

AI总结 本文提出统一框架扩展光束平差法,将高阶几何关系建模为类相机实体,保留稀疏性并提升稳定性,在相当运行时下生成更丰富三维结构与更高几何精度。

Comments To appear at ECCV 2026. Code available as part of the LIMAP toolbox at https://github.com/cvg/limap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04018 2026-09-04 cs.LG stat.AP stat.ME 新提交

A location-invariant estimator of extremal quantile treatment effects for heavy-tailed distributions

针对重尾分布的极值分位数处理效应的位置不变估计量

Xin Yu, Shuwei Huang, Jicheng Liu, Jielin Tang, Bolin Wang, Yunxiao Zhang, Tian Zhao

机构 * Huazhong University of Science and Technology(华中科技大学) Tencent(腾讯)

AI总结 针对重尾分布极值QTE估计量的位置偏移不不变问题,通过适配位置不变EVI估计量并替换外推方案,提出位置不变的极值QTE估计量,经模拟验证其性质良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03992 2026-09-04 cs.CL eess.AS 新提交

Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis

无对齐文本音频盒(Text-AB):用于语音配音和全双工对话合成

Sanyuan Chen, Min-Jae Hwang, Sho Inoue, Anna Sun, Bokai Yu, David Kant, Dongmin Hyun, Dorian Desblancs, Gregory Antonovsky, Oleg Repin, Peng-Jen Chen, Xutai Ma, Zehai Tu, Juan Pino, Wei-Ning Hsu

机构 * FAIR at Meta(Meta FAIR研究院)

AI总结 该研究提出无对齐文本音频盒(Text-AB),基于流匹配扩散Transformer,在48万小时语音预训练后经微调,实现高质量配音与全双工对话合成,性能大幅优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03952 2026-09-04 cs.CV 新提交

WorldReward: Reward Modeling for Camera-Conditioned World Models

WorldReward:面向相机条件世界模型的奖励建模

Yibin Wang, Zehan Wang, Junshu Tang, Zhimin Li, Yujie Zhou, Jiazi Bu, Pengyang Ling, Feng Han, Zhixiong Zhang, Long Xing, Shengyuan Ding, Ziang Li, Cheng Jin, Yuhang Zang, Jiaqi Wang, Tianyu Pang

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯混元) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 该研究提出WorldReward,一种基于VLM的成对偏好奖励模型,解决相机条件世界模型现有奖励函数的缺陷,在WorldReward-Bench上超GPT-5.5,还提升了HY-WorldPlay 1.5的动作与视觉质量。

Comments Website: https://codegoat24.github.io/WorldReward

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03919 2026-09-04 cs.CV 新提交

OctWorld: Long-Range World-Consistent Video Generation with Octree-Based 3D Mapping

OctWorld:基于八叉树三维映射的长程世界一致视频生成

Zelong Lv, Sicheng Xu, Jianfeng Xiang, Ruicheng Wang, Yue Dong, Yu Deng, Guangzhong Sun, Jiaolong Yang

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

AI总结 研究提出带持久三维记忆的视频扩散框架OctWorld,通过引入空间自适应三维记忆OctMap解决长程生成的空间一致性难题,生成的视频在基准及长程设置下优于现有方法。

Comments Accepted to ECCV 2026 Project page: https://maxtirerror.github.io/octworldpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03906 2026-09-04 cs.RO 新提交

Revisiting Topological Graphs for Macro Action based Closed-loop Reinforcement Learning of Vision Language Navigation in Continuous Environment

重新审视连续环境中基于宏观动作的视觉语言导航闭环强化学习的拓扑图

Shuhao Ye, Sitong Mao, Yuxiang Cui, Yufei Wei, Xuan Yu, Shichao Zhai, Wen Chen, Shunbo Zhou, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Huawei Technologies Co., Ltd(华为技术有限公司) Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)

AI总结 该研究针对连续环境视觉语言导航的模仿学习缺陷,提出分层马尔可夫决策过程结合拓扑图与动作感知价值头的方法,在R2R-CE等基准取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03894 2026-09-04 cs.CL cs.SE 新提交

CROCODIL: Cross-Model Code Editing with LLMs

CROCODIL:基于大语言模型的跨模型代码编辑

Linghan Zhong, Aditya Thimmaiah, Jayanth Srinivasa, Milos Gligoric, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cisco Research(思科研究院)

AI总结 本研究针对多LLM协作时的外来代码过度编辑问题,提出CROCODIL后训练框架,通过相似度奖励与执行奖励的乘积优化,在保证功能正确的同时减少了不必要的代码编辑。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03892 2026-09-04 cs.CV cs.AI cs.RO 新提交

GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs

GraFT:一种基于3D场景图的多模态大语言模型空间推理无训练框架

Junqing Du, Fernando Ropero, Erkin Turkoz, Yanfeng Zhang, Lu Liu

机构 * Riemann Lab, Huawei Technologies(华为技术有限公司黎曼实验室)

AI总结 GraFT是一种无训练框架,通过3D场景图为多模态大语言模型提供三类空间推理能力,在ScanQA、VSI-Bench数据集上显著提升了模型空间推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03880 2026-09-04 cs.AI 新提交

Xiaomi-TabLDM: A Tabular Foundation Model Technical Report

Xiaomi-TabLDM:表格基础模型技术报告

TabLDM Team, Penghui Wang, Wei Liu, Hong Wang, Chengyue Huang, Yuxi Sun, Zirui Wang, Hongming Huang, Quan Wang, Chunxiao Liu, Erli Meng, Bin Wang

机构 * Xiaomi(小米)

AI总结 本研究提出Xiaomi-TabLDM表格基础模型,仅在SCM生成的合成数据预训练,通过三阶段训练策略等技术,在多基准回归任务表现优异且效率高,还可通过测试时计算扩展提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03874 2026-09-04 cs.AI 新提交

STAIR (STructure Aware Information Retriever): A novel dataset and LLM based retriever for document structure augmentation

STAIR(结构感知信息检索器):用于文档结构增强的新型数据集与基于大语言模型的检索器

Vineet Kumar, Meghanadh Pulivarthi, vishwajeet kumar, Jaydeep Sen, Riyaz Ahmad Bhat, Sachindra Joshi

机构 * IBM(国际商业机器公司) Amazon Books Science(亚马逊图书科学部门)

AI总结 本研究提出新型检索系统STA IR及基准SearchTome,利用语料库目录增强检索,在SearchTome上的Recall@1达82.6%,显著优于DSI、BM25等基线,可构建低幻觉IR系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03807 2026-09-04 cs.LG cs.AI 新提交

Free Pause Tokens

免费暂停令牌

John Langford, Nathan Godey, Giovanni Monea, Yoav Artzi, Harry Dong, Ying Fan, Gustavo de Rosa, Zheng Zhan

机构 * Microsoft(微软) Cornell University(康奈尔大学)

AI总结 该研究提出免费暂停令牌,通过权重共享主干的并行预测流承载额外计算,在不增加推理开销的前提下,以1.14倍训练计算成本实现Transformer下一个令牌预测性能提升2-3centinats。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03673 2026-09-04 cs.CV 新提交

Do Video Generators Track the World Across Segments? A Benchmark and Method for World-State Reasoning in Video Continuation

视频生成器是否会跨片段追踪世界?视频延续中世界状态推理的基准与方法

Yingmao Miao, Pengfei Zhang, Chaoran Xu, Meng Yu, Jing Tang, Xiangxiang Chu, Chao Shen, Chenhao Lin

机构 * Alibaba Group(阿里巴巴集团)

AI总结 该研究针对视频生成器无法可靠追踪视频世界状态的问题,构建了基准Statebench并提出方法Stateagent,将可控视频延续的全案例状态分数从45.2提升至69.3,还有益于一分钟规模的故事生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03657 2026-09-04 cs.CV 新提交

Rethinking 3D Noise: Learning 3D-Aware Video Priors via Optimization-Free Morphological Perturbations

重新思考3D噪声:通过无优化形态扰动学习3D感知视频先验

Onat Şahin, Mohammad Altillawi, George Eskandar, Carlos Carbone, Ziyuan Liu

机构 * Technical University of Munich(慕尼黑工业大学) Huawei Heisenberg Research Center(华为海森堡研究中心) Tavus(塔沃斯公司)

AI总结 该研究针对3D场景表示在稀疏视图下的伪影问题,提出无优化的3D形态扰动正则化方法,结合3DGS实现更强几何先验,提升视频模型的3D感知能力及下游机器人操纵任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03582 2026-09-04 cs.LG 新提交

WeatherNext 3: Increasing resolution and performance of global weather models with raw observations

WeatherNext 3:利用原始观测数据提升全球气象模型的分辨率与性能

Stephan Rasp, Boris Babenko, Dominic Masters, Andrew El-Kadi, Samier Merchant, Guy Shalev, Ilan Price, Fred Zyda, Remi Lam, Sasha Shysheya, Matthew Willson, Stratis Markou, Shreya Agrawal, Suhani Vora, Mohammed Alewi Hassen, Sunny Mak, Tom R. Andersson, Megan Bela, Akib Uddin, Nofar Peled Levi, Ben Gaiarin, Ferran Alet, Aaron Bell, Peter Battaglia, Alvaro Sanchez-Gonzalez

机构 * Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Google(谷歌公司)

AI总结 WeatherNext 3通过摄入低延迟地球静止卫星数据,实现每小时预报、与物理模型相当的分辨率及多源观测利用,解决了AI气象模型的分辨率与观测利用缺陷,提升了中期预报性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03526 2026-09-04 cs.AI 新提交

CulturalMenuBench: Probing the Knowledge-Application Gap in Multimodal Culinary Reasoning

CulturalMenuBench:探究多模态烹饪推理中的知识应用差距

Bo Zeng, Linfeng Gao, Peiqin Lin, Yu Zhao, Mingyan Zeng, Yu Tong, Xintong Wang, Linlong Xu, Longyue Wang, Weihua Luo, Qinggang Zhang, Jinsong Su

机构 * Alibaba Group(阿里巴巴集团) Xiamen University(厦门大学) University of Hamburg(汉堡大学)

AI总结 该研究推出多模态烹饪推理基准CulturalMenuBench,发现模型在食物识别任务中存在知识应用差距,无法通过视觉输入激活文化知识,推动了关联感知、过程与文化背景的训练。

Comments Accepted to EMNLP 2026 Findings. Code and data: https://github.com/BobTsang-NLP/CulturalMenuBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03515 2026-09-04 cs.AI 新提交

What Matters for Aggressive Decoding-Time KV Eviction? Temporal Aggregation and Ranking Preservation

激进解码时KV驱逐的关键因素:时间聚合与排名保留

Bo Zeng, Yu Zhao, Yefeng Liu, Zhihong Lu, Xuanfan Ni, Xintong Wang

机构 * Ant Group(蚂蚁集团) Alibaba Group(阿里巴巴集团) Universität Hamburg(汉堡大学)

AI总结 该研究聚焦激进解码时KV驱逐的关键因素,提出基于EMA的InertiaKV及其变体,揭示时间聚合与排名保留的重要性,相关方法可提升解码吞吐量且不显著降低质量。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03493 2026-09-04 cs.AI 新提交

Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models

让每一次工具调用都发挥作用:面向智能体视觉语言模型的必要工具-证据路径奖励

Xingming Long, Yu Liu, Zhiwei Yang, Hanqi Feng, Shaojie Zhang, Barnabas Poczos, Chao Jiang, Zhenbo Luo, Lei Jiang, Pei Fu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Department of Machine Learning, Carnegie Mellon University(卡内基梅隆大学机器学习系) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

AI总结 针对智能体视觉语言模型工具调用监督不足的问题,提出NTEP标注方案与NTEP-R监督机制,在7个基准上验证了NTEP-8B可提升搜索准确率与工具使用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏