arXivDaily arXiv每日学术速递 周一至周五更新

Company Research

大厂专区

按论文发表机构汇总科技公司的最新研究成果。直属研究团队按母公司归类,机构信息由 AI 分析生成,仅供参考。

2026-08-19 至 2026-08-19 共收录 57
2608.18077 2026-08-19 cs.RO 新提交

Hydra-0: Action Flow for Generalist World Modeling and Control

Hydra-0:面向通用世界建模与控制的动作流

Hongyu Li, Bowen Wen, Xinghao Zhu, Yixuan Wang, Yilun Du, Yunzhu Li, George Konidaris, Stan Birchfield, Soha Pouya, Chenran Li, Yan Chang

机构 * NVIDIA(英伟达) Brown University(布朗大学) Columbia University(哥伦比亚大学) Harvard University(哈佛大学)

AI总结 本研究提出Hydra-0通用世界模型,以动作流为条件实现跨实体、任务等的通用建模控制,在RoboLab基准获高相关性,还涌现出逆模式,可助力机器人控制。

Comments Project page: this https URL (https://nvidia-isaac.github.io/video_to_data/hydra-0/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18076 2026-08-19 cs.CV cs.AI 新提交

From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation

从语料到协同进化的能力:面向通用图像生成的以能力为中心的数据设计

Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Xiaoli Xu, Zhengze Xu, Hao Yan, Yuhang Yu, Mingzhou Zhang, Mengting Chen

机构 * Alibaba Group(阿里巴巴集团)

AI总结 该研究提出能力驱动的数据基础设施,构建三类监督引擎,整理大规模图像语料,训练多模态扩散模型,在CPI-Bench等评估中展现良好生成与迁移能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18066 2026-08-19 cs.AI cs.CL cs.LG 新提交

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

自改进智能体的脆弱性:方差、任务顺序与规格不足

Qinyuan Ye, Yu Li, Yada Pruksachatkun, Jiaxin Zhang, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院)

AI总结 本研究通过多轮运行与打乱任务顺序的实验,揭示当前基于记忆的自改进智能体存在脆弱性,发现其性能受方差与任务顺序影响,还指出规格不足是相关诱因,呼吁采用更严格评估方案与人工监督机制。

Comments Code: this https URL (https://github.com/SalesforceAIResearch/self-improve-fragility) Data: this https URL (https://huggingface.co/datasets/Salesforce/self-improve-fragility)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18063 2026-08-19 cs.CV 新提交

EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image Editing

EditBridge:迈向忠实且高效的超高清图像编辑

Jiayi Song, Shijie Huang, Fangtai Wu, Yubo Huang, Zhenxiong Tan, Songhua Liu, Jiaming Liu, Ruihua Huang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) National University of Singapore(新加坡国立大学)

AI总结 针对现有扩散图像编辑模型无法高效处理超高清图像的问题,提出EditBridge扩散桥框架,通过先验引导的块级稀疏注意力机制实现4K高保真编辑,速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18027 2026-08-19 cs.CL 新提交

Chain-of-Experience for Continual LLM Improvement

用于持续改进大语言模型的经验链(Chain-of-Experience, CoE)

Haoqin Tu, Yunhao Fang, Yizhong Wang, Cihang Xie, Shen Yan

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) Bytedance Seed(字节跳动Seed)

AI总结 该研究提出经验链(CoE)方法,通过迭代交互让LLM从经验中持续改进,在多领域8种LLM上验证其比无反馈基线更优,结合互补反馈可进一步提升,且每令牌准确率高于现有测试时策略。

Comments H.T. and Y.F. contributed to this work equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18011 2026-08-19 cs.CL 新提交

The IOL-AI Challenge: An Open Challenge towards Advancing Linguistic Reasoning

IOL-AI挑战赛:一项旨在推进语言推理的开放挑战赛

Eduardo Sánchez, Rita Berrada, Dan-Mircea Mirea, Sara Rajaee, Alexander Piperski, Ana Meta Dolinar, Boris Iomdin, Andrey Nikulin, Mariya Shmatova, Marzieh Fadaee, Julia Kreutzer

机构 * University College London(伦敦大学学院) Meta CentraleSupélec(中央高等电力学院) McGill University(麦吉尔大学) Cohere Labs(Cohere实验室) Princeton University(普林斯顿大学) University of Amsterdam(阿姆斯特丹大学) Stockholm University(斯德哥尔摩大学) Faculty of Liberal Arts and Sciences(文理学院) Universidade Federal de Goiás(戈亚斯联邦大学)

AI总结 本文介绍基于2026年IOL个人赛未公开题目的IOL-AI挑战赛,评估含自动与评审团评分,测试显示模型能力不由规模决定,语言推理是泛化推理技能的强基准代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18009 2026-08-19 cs.CV 新提交

Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering

基于记忆树引导的关键帧查询的高效三维问答

Hsiang-Wei Huang, Fu-Chen Chen, Li-Wu Tsao, Cheng-Han Lee, Che-Chun Su, Lu Xia, Ronghui Peng, Jenq-Neng Hwang, Min Sun, Cheng-Hao Kuo

机构 * University of Washington(华盛顿大学) Amazon(亚马逊公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究针对具身场景三维问答的效率问题,提出MemTree3D记忆树引导的关键帧选择方法,在OpenEQA数据集上显著提升GPT-4o与LLaVA-OneVision-7B的问答性能,优于现有视觉搜索方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17995 2026-08-19 cs.CV 新提交

AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

AViTS:用于高效动态分辨率生成的自适应时空令牌选择

Haoran Qin, Zhengan Yan, Shikang Zheng, Xiaobing Tu, Jiacheng Liu, Yuqi Lin, Chang Zou, JinShan Liu, Peiliang Cai, Xiantao Zhang, Jinkui Ren, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Terminal Intelligent Computing Division, Alibaba Cloud(阿里云终端智能计算事业部) Jilin University(吉林大学) Xi’an Jiaotong University(西安交通大学)

AI总结 该研究针对扩散变换器动态分辨率采样的冗余计算问题,提出AViTS框架,通过时空重要性感知的选择性上采样减少冗余,在FLUX等模型上实现显著加速且与其他优化技术兼容

Comments Accepted to ECCV 2026. 20 pages including appendix. Code: this https URL (https://github.com/QHR69/AViTS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17988 2026-08-19 cs.CV 新提交

GS-Voxel: Fitting-Free Structured Latents for Large-Scale 3DGS Generation

GS-Voxel:用于大规模3DGS生成的免拟合结构化隐变量

Ming Qian, Zijian Wang, Minchao Sun, Jincheng Xiong, Hang Zhang, Mu Xu, Chi Wang, Baoquan Chen

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Amap(高德地图) Alibaba(阿里巴巴)

AI总结 GS-Voxel是免拟合结构化隐变量框架,可将预优化3DGS重建转为稀疏活跃体素,通过GS专用VAE编码为稀疏3D隐变量,结合图像条件流模型实现大规模航空3DGS场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17981 2026-08-19 cs.LG 新提交

Recirculation

再循环

Michael C. Mozer, Shoaib Ahmed Siddiqui, Danny Sawyer, Sunny Sanyal, Rosanne Liu

机构 * Google DeepMind(谷歌DeepMind) University of Texas, Austin(德克萨斯大学奥斯汀分校)

AI总结 该研究提出推理时架构增强技术“再循环”及其自适应变体,无需额外训练,可显著降低Gemma3系列模型的困惑度、提升推理任务准确率,为架构演进提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17973 2026-08-19 cs.CV 新提交

LinCa: Accelerating Diffusion Models via Learnable Decomposed Feature Caching

LinCa:基于可学习分解特征缓存的扩散模型加速方法

Jinshan Liu, Haoran Qin, Xiaobing Tu, Jiacheng Liu, Jiahui Hu, Zhengan Yan, Yukun Xie, Kerui Shen, Jinkui Ren, Yuqi Lin, Xiantao Zhang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Terminal Intelligent Computing Division, Alibaba Cloud(阿里云终端智能计算事业部) South China University of Technology(华南理工大学) Jilin University(吉林大学)

AI总结 本文提出LinCa框架,通过可学习可逆网络分解缓存特征并差异化预测,仅需少量额外参数即可在5-7倍加速下使扩散模型保持近无损质量,性能优于现有方法。

Comments Accepted to ECCV 2026. 28 pages including appendix. Code: this https URL (https://github.com/QHR69/LinCa)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17832 2026-08-19 cs.CV 新提交

GenRec: Knowing Where to Reconstruct and Where to Generate

GenRec:明确何处重建、何处生成

Ata Çelen, Jaewoo Jung, Federico Tombari, Marc Pollefeys, Sunghwan Hong, Michael Niemeyer, Daniel Barath

机构 * KAIST(韩国科学技术院) Google(谷歌公司) Microsoft(微软公司) ETH Zürich(苏黎世联邦理工学院)

AI总结 GenRec 是一种多视图流匹配模型,通过架构等内置重建与生成划分,在 RealEstate10K 等数据集的单视图外推、两视图插值任务中,兼顾观测区域高重建保真度与未观测区域优感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17800 2026-08-19 cs.AI 新提交

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

StartupBench:基于市场验证的端到端工作流程的通用智能体基准测试

Liya Zhu, Xin Ma, Tao Liu, Haodong Wang, Ge Zhang, Jingzhe Ding, Qingshui Gu, Yongjie Zhong, Jinxiang Meng, Yuan Gao, Yunqiu Zhou, Hao Zhu, Jifeng He, Yongzhi Liao, Xinyi Zhang, Chaoxin Li, Yi Zhu, Xi Lin, Duju Zeng, Xiang Gao, Wen Zhang, Yunyang Wang, Duo Wang, Huan Zhou, Zuo Wang, Jin Chen, Kaiyuan Zhang, Chuqian Yu, Tianhao Yu, Longxiang Liu, Jianbo Xue, Huimin Che, Jiahao Wang, Yujia Qin, Jiaheng Liu, Shen Yan, Xiaolong Chang, Wenhao Huang

机构 * ByteDance Seed(字节跳动 Seed) Nanjing University(南京大学) M-A-P

AI总结 本文提出StartupBench基准测试,基于市场验证的AI初创产品工作流程评估通用智能体,发现当前最强模型仅完成约30%任务,该基准可衡量智能体完成现实用户任务的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17795 2026-08-19 cs.CL 新提交

TraceSQL: Traceable Answerability Estimation for Reference-Free Text-to-SQL Verification

TraceSQL:无参考文本到SQL验证的可追踪答案性估计

Neelesh Kumar Shukla, Debasmita Panda, Srutanik Bhaduri, Aditya Banerjee, Viji Krishnamurthy

机构 * Oracle Corporation(甲骨文公司)

AI总结 针对无参考文本到SQL验证的可追踪性不足问题,提出基于67种诊断特征的轻量模型TraceSQL,在BIRD数据集上优于基线模型,可提供可追溯的预测证据。

Comments 9 pages main paper with 6 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17731 2026-08-19 cs.AI 新提交

Evaluating the Diversity of AI-Generated Content with Diversity Profiles

用多样性轮廓评估AI生成内容的多样性

Xiuyuan Hu, Xuege Hou, Guoqing Liu, Yang Zhao, Jieran Li, Dongbiao Sun, José Miguel Hernández-Lobato, Hao Zhang, Xue Liu

机构 * Tsinghua University(清华大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Microsoft Research(微软研究院) University of Cambridge(剑桥大学) McGill University(麦吉尔大学)

AI总结 针对现有AI生成内容多样性评估标量指标的矛盾性与局限性,提出曲线值的多样性轮廓框架,为生成式AI评估提供更透明、感知分辨率的多样性比较方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17695 2026-08-19 cs.CV 新提交

Magnitude-Direction Decoupling for Fast Video Generation with Flow Matching Models

基于流匹配模型的快速视频生成的幅度-方向解耦方法

Haonan Xu, Feiyang Chen, Songkui Chen, Hongpeng Pan, Zhefeng Wang, Xinyu Duan, Baoxing Huai, Yang Yang

机构 * Nanjing University of Science and Technology(南京理工大学) Huawei(华为)

AI总结 针对流匹配视频生成模型计算开销高的问题,提出MDD方法,通过解耦幅度与方向复用轻量模型,在Wan2.1上实现最高2.95倍加速,性能优于现有方法且保真度高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17616 2026-08-19 cs.AI cs.CL cs.LG 新提交

MoNe: Modular Neural Memory for Efficient Long Context Inference

MoNe:用于高效长上下文推理的模块化神经记忆

Wonguk Cho, Kyubyung Chae, Tribhuvanesh Orekondy, Sunghyun Park, Hyoungwoo Park, Jeongho Kim, Arash Behboodi, Kyuwoong Hwang, Sungrack Yun

机构 * Qualcomm AI Research(高通人工智能研究部门) Qualcomm Technologies, Inc(高通技术公司)

AI总结 研究提出MoNe,一种可附加到冻结预训练Transformer的轻量级模块化神经记忆,通过两阶段设计实现高效长上下文推理,在128K令牌场景下较ICL降低约80%计算与内存开销,泛化性能优于ICL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17587 2026-08-19 cs.CL 新提交

Write, Execute, Refine: From Skill Followers to Skill Optimizers via Reinforcement Learning from Execution Feedback

编写、执行、优化:通过执行反馈强化学习从技能跟随者到技能优化器

Kang Peng, Zhiwei Zhang, Yichen Zhang, Zezhong Wang, Yiming Du, Geng Tu, Baojun Wang, Bin Liang, Ruifeng Xu, Kam-Fai Wong

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本研究提出WER多阶段框架,通过冻结执行器、程序验证器打分及混合轨迹优化训练技能优化器,在BFCL v4和tau2-bench上显著提升智能体工具使用性能,4B优化器表现优于通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17566 2026-08-19 cs.CV 新提交

CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing

CoinVE-200K:用于组合式指令引导视频编辑的大规模高质量数据集

Fuchen Long, Cong Wang, Zitao Gao, Wenhao Zhong, Yu Cheng, Xiaolu Hou, Yan Li, Xiao Cao, Xinlong Sun, Xi Chen, Yu Liu

机构 * Tencent(腾讯)

AI总结 本文提出用于组合式指令引导视频编辑的大规模高质量数据集CoinVE-200K,构建基准CoinVE-Bench及22B参数模型CoinVE-Edit,在基准测试中表现优异。

Comments Project page: this https URL (https://coinve200k.github.io); Dataset is available at this https URL (https://huggingface.co/datasets/FireCRT/CoinVE-200K;) see source codes at this https URL (https://github.com/coinve200k/CoinVE-200K)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17528 2026-08-19 cs.AI cs.SE 新提交

Agent Lightning v1.0: Towards Harnessed Agentic RL

Agent Lightning v1.0:走向可控的智能体强化学习

Zhiyuan He, Siwei Zhang, Zhiwen Zhou, Yuqing Yang, Yu Kang, Yuge Zhang, Luna K. Qiu, Tin Yan Tsui, Jiahang Xu, Chong Luo

机构 * Microsoft(微软) Fudan University(复旦大学) Zhejiang University(浙江大学) University of Edinburgh(爱丁堡大学)

AI总结 研究针对可控智能体强化学习的挑战,推出轻量级框架 Agent Lightning v1.0,经评估可将 Qwen3.5-9B 在 SWE-bench Verified 上的性能提升14.6个百分点,发布完整流程脚本以推进相关可复现研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17514 2026-08-19 cs.CV cs.MM 新提交

SE-MoLoRA: Shared-Expert LoRA Adapters for Domain-Specific Photographic Assessment

SE-MoLoRA:用于特定领域摄影评估的共享专家LoRA适配器

Bishwash Khanal, Anlan Zhang, Sasu Tarkoma, Tommi Mikkonen, Abhishek Kumar

机构 * Faculty of Information Technology(信息技术学院) University of Jyväskylä(于韦斯屈莱大学) Adobe Research(奥多比研究院) University of Helsinki(赫尔辛基大学)

AI总结 本文提出SE-MoLoRA框架,通过共享LoRA专家与路由适配器解耦通用摄影知识和专业判断,在摄影评论生成任务上显著提升BERTScore-F1,且更受偏好、参数更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17492 2026-08-19 cs.SD 新提交

FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations

FireRedTTS3:基于语义丰富的语音表征的统一语音生成与编辑

Feiyu Shen, Kun Xie, Yichen Wu, Ziqi Dai, Yichen Han, Junjie Li, Xuelong Geng, Fenglong Xie, Lei Xie, Xu Tang, Yao Hu

机构 * Xiaohongshu(小红书)

AI总结 本研究提出FireRedTTS3框架,利用冻结音频编码器正则化特征空间缓解自回归误差,其两个变体在对应任务数据集上均优于竞争系统,实现稳定可控的高保真语音生成与编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17402 2026-08-19 cs.CV 新提交

MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding

MoE-ViE:用于高效图像与视频理解的混合专家视觉编码器

Bonan Zhang, Shiyu Dong, Quan Hung Tran, Katharina Gschwind, Shuqi Yang, Sijia Chen, Adel Ahmadyan, Seungwhan Moon, Lu Zhang, Ahmed Kirmani, Babak Damavandi, Anuj Kumar

机构 * Meta

AI总结 本研究提出MoE-ViE,通过细粒度MoE拓扑、无辅助损失平衡变体、专用MoE内核及帧级蒸馏等设计,实现高效图像与视频理解,性能优于对应密集模型及更大规模SOTA编码器。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17393 2026-08-19 cs.AI 新提交

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

LEGO-RL:利用原生强化学习实现编码智能体

Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) The Chinese University of Hong Kong(香港中文大学)

AI总结 LEGO-RL 是桥接原生编码智能体 harness 与策略梯度优化的框架,通过三大支柱解决训练不匹配问题,提升 Qwen3.5-35B-A3B 在三个编码基准上的性能,且保持高概率相关性。

Comments Webpage: this https URL (https://lego-rl.pages.dev)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17319 2026-08-19 cs.AI 新提交

Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents

Wuying-Browser-Agent:以真实场景为中心的基础长时程浏览器智能体

AIMAE Team: Tianxiang Chen, Yan Cheng, Zhangye Han, Xiaowei Li, Chang Liu, Cheng Liu, Zhongqiang Ma, Long Peng, Xiaobing Tu, Yinggui Wang, Hongliang Wei, Chen Wu, Daiping Xin, Kunyu Zhou, Pengyang Zhou, Peiyuan Chen, Ziyuan Chen, Yutao Deng, Chunyu Dong, Xiangyu Fu, Yicheng Feng, Ruian He, Haochen Li, Miancan Liu, Zhengqin Liu, Wei Peng, Jinkui Ren, Haoyu Tan, Dong Xiao, Rongkun Xue, Shujian Yang, Xianhang Ye, Ziqi Yuan, Ziyang Yu, Linghan Zhang, Xiantao Zhang, Xuanpu Zhao, Yinan Zhao, Zhenghui Zhao, Bin Zhu, Likai Zou

机构 * Alibaba Cloud(阿里云) End-User Intelligent Computing BU(终端用户智能计算业务部) AI Model Application & Engineering Team(AI模型应用与工程团队)

AI总结 本文提出Wuying-Browser-Agent统一框架,通过多层面技术对齐解决浏览器智能体实际部署问题,在多项基准取得最优成绩,且具备通用智能体迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17271 2026-08-19 cs.AI 新提交

ASI-Bench: At the Dawn of Artificial Superintelligence

ASI-Bench:人工智能超级智能的黎明

Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan, Hengyu Wang, Honghe Ren, Xiaohan Jia, Xueyang Zhou, Xiaoyu Cao, Yongchao Chen, Yuanning Feng, Junhao Wu, Cheng Zhang, Sijia Chen, Haoyu Xue, Chengsong You, Huan Wang, Koutian Wu, Peigan Gao, Jiakun Wu, Wenzhe Li, Ergan Shang, Qingyuan Zheng, Jingjing Zhou, Ruixuan Jia, Yan Xu, Hongrui Zhang, Xiao-Han Ma, Zhengxiang Cheng, Yuexing Hao, Liting Mai, Xianglin Ji, Wenjun Zhang, Zhuofan Chen, Yixiao Huang, Chi Wang, Wenyue Hua, Yilun Hao, Yuantao Zhai, Ziyan Zhao, Jingyan Xie

机构 * Tsinghua University(清华大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Boston University(波士顿大学) University of Queensland(昆士兰大学) University of Science and Technology of China(中国科学技术大学) Flatiron Institute(弗拉蒂伦研究所) Microsoft Research(微软研究院) AG2 AI(AG2 AI公司)

AI总结 研究人员推出首个联合评估AI创新探索与自主科学执行能力的基准ASI-Bench,逐步减少人类方法指导测试AI自主科研能力,发现当前AI仍严重依赖人类指导,该基准面向全球开放邀请贡献。

Comments 16 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17253 2026-08-19 cs.LG cs.AI cs.CV 新提交

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL

Co-RL:多智能体强化学习中多样群体涌现的无监督推理

Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang, Yuanyuan Shi, Ziang Xiao, Nuno Vasconcelos, Yijiang Li

机构 * University of Exeter(埃克塞特大学) ByteDance(字节跳动) Johns Hopkins University(约翰斯·霍普金斯大学) UC San Diego(加州大学圣迭戈分校)

AI总结 本研究提出Co-RL框架,通过参数不共享的多智能体协作训练,利用同伴奖励减少对真实标注的依赖,提升纯文本及多模态任务的推理性能,缓解训练崩溃与响应同质化问题。

Comments 30 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17202 2026-08-19 cs.AI cs.CR 新提交

Fool's Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight Models

愚人金:针对开放权重模型安全移除攻击的防御性欺骗

Mark Russinovich

机构 * Microsoft Azure(微软Azure)

AI总结 针对开放权重模型易被移除安全对齐的问题,提出“愚人金”防御,通过训练仅在被攻击状态显现的伪造诱饵,使被攻击模型对危险请求输出高比例假回答,且无法区分真假,同时不影响干净状态的良性行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17150 2026-08-19 cs.AI cs.CL cs.HC 新提交

KnowSim: Evaluating Information Calibration in LLM Assistants with User Simulators that Learn

KnowSim:用学习的用户模拟器评估大语言模型助手的信息校准

Yoonjoo Lee, Hyoungwook Jin, Tae Soo Kim, Shaoyang Zhang, Philippe Laban, Q. Vera Liao

机构 * University of Michigan(密歇根大学) KAIST(韩国科学技术院) Microsoft Research(微软研究院)

AI总结 本研究提出KNOWSIM框架,通过带显式知识状态的用户模拟器评估LLMs的信息校准,验证后其性能优于基线,可揭示用户知识水平与LLMs的适配关系。

Comments 30 pages, 6 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17129 2026-08-19 cs.CV cs.RO 新提交

PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents

PROBE:基于操作的视觉问答(使用VLM智能体)

Vineet Bhat, Siyi Chen, Alex Zook, Xuning Yang, Stan Birchfield, Valts Blukis, Jonathan Tremblay

机构 * NVIDIA(英伟达)

AI总结 针对现实杂乱环境中需操作遮挡物体的视觉问答问题,提出PROBE框架,含模拟器、基准测试集及微调方案,提升VLM智能体性能并验证模拟到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏