arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5021 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5021 篇

2605.30738 2026-06-01 cs.AI 57%

MAVEN: Improving Generalization in Agentic Tool Calling

MAVEN:提升智能体工具调用的泛化能力

Omkar Ghugarkar, Vishvesh Bhat, Muhammad Ahmed Mohsin, Asad Aali

机构 * CoreThink AI, USA(CoreThink AI, 美国) Stanford University, Stanford, CA, USA(斯坦福大学, 加州斯坦福, 美国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出MAVEN框架,通过轻量级符号推理脚手架实现结构化分解、自适应工具编排和中间验证,在多个基准测试中显著提升模型性能,且成本仅为前沿专有模型的约1/10。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15706 2026-06-01 cs.LG 57%

Differentiable Mixture-of-Agents Incentivizes Swarm Intelligence of Large Language Models

可微分的混合智能体激励大型语言模型的群体智能

Xingjian Wu, Junkai Lu, Siyu Yan, Xiangfei Qiu, Jilin Hu, Chenjuan Guo, Bin Yang

机构 * East China Normal University(华东师范大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 提出可微分的混合智能体(DMoA)框架,通过可微分的上下文感知路由机制动态激活智能体,实现推理过程中的弹性协作,并在9个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30326 2026-05-29 cs.RO cs.AI 57%

RoboWits: Unexpected Challenges for Robotic Creative Problem Solving

RoboWits:机器人创造性问题解决中的意外挑战

Chunru Lin, Hongxin Zhang, Fenghao Yu, Zhehuan Chen, Thomas L. Griffiths, Yejin Choi, David Held, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Princeton University(普林斯顿大学) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RoboWits双臂机器人基准,通过多智能体协作的自动化任务生成流水线评估机器人在几何、材料和装配推理中的认知推理、创造性工具使用及鲁棒性,发现预训练VLA在突变任务中表现脆弱。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30227 2026-05-29 cs.MA cs.AI 57%

Unifying Temporal and Structural Credit Assignment in LLM-Based Multi-Agent Prompt Optimization

统一基于LLM的多智能体提示优化中的时间与结构信用分配

Wenwu Li, Yuran Song, Mingze Zhao, Bo Jin, Wenhao Li

机构 * Tongji University(同济大学) The University of Hong Kong(香港大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出通过时间信用(状态空间瓶颈识别关键轮次)和结构信用(固定角色策略隔离智能体贡献)分解误差信号,并利用离散言语化块坐标下降算法迭代优化角色提示和聚合协议,降低查询复杂度并提升性能。

Comments 15 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30159 2026-05-29 cs.AI 57%

Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents

元认知记忆策略优化用于长视野LLM智能体

Ziyan Liu, Zhezheng Hao, Yeqiu Chen, Hong Wang, Jingren Hou, Ruiyi Ding, Yongkang Yang, Wence Ji, Wei Xia, Feng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对长视野任务中记忆策略训练缺乏中间监督的问题,提出基于信念熵的元认知记忆策略优化(MMPO),通过自监督代理惩罚高认知不确定性摘要,提升长期推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30136 2026-05-29 cs.AI 57%

Enhancing Multi-Agent Communication through Attention Steering with Context Relevance

通过上下文相关性的注意力引导增强多智能体通信

Hongxiang Zhang, Yuan Tian, Tianyi Zhang

机构 * Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对LLM多智能体系统中长对话历史导致信息稀释的问题,提出无训练的上下文管理方法Agent-Radar,利用时空衰减机制动态引导注意力,在五个基准上取得最高7.64个绝对点的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29966 2026-05-29 cs.AI 57%

Compass: Navigating Global Marine Lead Data Integration through Expert-Guided LLM Agent

Compass: 通过专家引导的LLM代理导航全球海洋铅数据整合

Yiming Liu, Bin Lu, Meng Jin, Ziyuan Sang, Shuo Jiang, Lei Zhou, Xinbing Wang, Chenghu Zhou, Jing Zhang

机构 * School of Information Science Electronic Engineering,\ Jiao Tong University Shanghai China School of Artificial Intelligence,\ Jiao Tong University Shanghai China State Key Laboratory of Estuarine Coastal Research,\ China Normal University Shanghai China School of Oceanography,\ Jiao Tong University Shanghai China Institute of Geographical Science Natural Resources Research,\ Academy of Sciences Beijing China Electronic Engineering,\ Jiao Tong University School of Artificial Intelligence,\ Jiao Tong University Coastal Research,\ China Normal University School of Oceanography,\ Jiao Tong University Natural Resources Research,\ Academy of Sciences

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对海洋铅数据分散于非结构化论文中的问题,提出专家引导的LLM代理框架Compass,结合知识树分解任务,从23万篇论文中提取3751条铅记录,构建最大海洋铅数据库,准确率达92%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29705 2026-05-29 cs.AI 57%

BitTP: The Lightweight Trajectory Prediction Model with BitLLM for Edge-Devices

BitTP:面向边缘设备的轻量级轨迹预测模型与BitLLM

Mincheol Kang, Hyunjin Lim, Bomin Kang, Daehee Park

机构 * KAIST, Republic of Korea(韩国釜山国立大学) DGIST, Republic of Korea(韩国国立庆北科学技术院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出BitTP,通过将LLM轨迹预测器转换为1.58比特轻量架构,在保持或提升预测质量的同时大幅降低内存和计算需求,实现边缘设备部署。

Comments Camera-ready version. Accepted as a findings paper at CVPR 2026. 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27667 2026-05-29 cs.SD cs.AI 57%

EvA: An Evidence-First Audio Understanding Paradigm for LALMs

EvA: 一种面向LALM的以证据为先的音频理解范式

Xinyuan Xie, Shunian Chen, Zhiheng Liu, Yuhao Zhang, Zhiqiang Lv, Liyin Liang, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Didi Chuxing(滴滴出行)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出EvA双路径架构,通过分层聚合和非压缩时间对齐融合增强声学证据保留,并在统一零样本协议下在MMAU、MMAR和MMSU上取得最佳开源感知结果,支持以证据为先的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29560 2026-05-29 cs.AI 57%

Battery-Sim-Agent: Leveraging LLM-Agent for Inverse Battery Parameter Estimation

Battery-Sim-Agent: 利用LLM智能体进行电池逆参数估计

Jiawei Chen, Xiaofan Gui, Shikai Fang, Shengyu Tao, Shun Zheng, Weiqing Liu, Jiang Bian

机构 * Peking University(北京大学) Microsoft Research(微软研究院) Zhejiang University(浙江大学) Chalmers University of Technology(皇家理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出Battery-Sim-Agent框架,将电池逆参数估计重构为推理任务,利用LLM智能体与高保真模拟器闭环交互,通过物理假设和结构化参数更新,显著优于贝叶斯优化等黑箱优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29559 2026-05-29 cs.CL 57%

LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents

LiteCoder-Terminal: 扩展用于学习语言代理的长时程终端环境

Xiaoxuan Peng, Kaiqi Zhang, Xinyu Lu, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.CL

AI总结 提出零依赖合成框架LiteCoder-Terminal-Gen,自动生成可执行且可验证的终端训练环境,构建大规模SFT和RL数据集,通过监督微调和直接多轮偏好优化显著提升语言代理在终端任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28825 2026-05-29 cs.CL 57%

MechELK: A Mechanistic Interpretability Framework for Eliciting Latent Knowledge in Large Language Models

MechELK:一种用于激发大型语言模型中潜在知识的机制可解释性框架

Ji-jun Park, Soo-joon Choi, Jiwon Jeong, Taeyang Yoon, Ju-Wan Lee

机构 * Dongguk University(东国大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出MechELK框架,通过定位、验证和激发三个阶段,利用稀疏自编码器特征分析和因果探测等方法,从大型语言模型中提取隐藏知识,在TruthfulQA等基准上平均激发准确率达84.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17220 2026-05-29 cs.CL 57%

Mindscape-Aware Retrieval Augmented Generation for Improved Long Context Understanding

心智景观感知的检索增强生成以改进长上下文理解

Yuqing Li, Jiangnan Li, Zheng Lin, Ziyan Zhou, Junjie Wu, Weiping Wang, Jie Zhou, Mo Yu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) WeChat AI, Tencent(腾讯微信AI) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出MiA-RAG框架,通过层次化摘要构建心智景观并统一检索与生成的条件,实现全局语义表示指导下的长上下文检索与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06182 2026-05-29 cs.CL 57%

Mixing Mechanisms: How Language Models Retrieve Bound Entities In-Context

混合机制:语言模型如何在上下文中检索绑定实体

Yoav Gur-Arieh, Mor Geva, Atticus Geiger

机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(塔尔瓦大学Blavatnik计算机科学与人工智能学院) Pr(Ai) 2 R Group(Pr(Ai) 2 R小组) Goodfire

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了语言模型在上下文中绑定并检索实体的三种机制(位置机制、词汇机制和反射机制),通过九种模型和十项绑定任务的实验揭示了它们的混合模式,并构建了一个因果模型以95%的一致性估计下一词分布。

Comments Accepted to ICLR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28705 2026-05-28 cs.LG 57%

Understanding Generalization and Forgetting in In-Context Continual Learning

理解上下文持续学习中的泛化与遗忘

Guangyu Li, Meng Ding, Lijie Hu

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) University of Buffalo(布法罗大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 提出首个上下文持续学习理论框架,分析预训练Transformer在单提示中处理多序列任务时的泛化与遗忘行为,揭示注意力机制导致的干扰和偏差。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28388 2026-05-28 cs.AI 57%

Mechanistically Interpreting the Role of Sample Difficulty in RLVR for LLMs

机制性解释样本难度在RLVR中对大语言模型的作用

Yue Cheng, Jiajun Zhang, Xiaohui Gao, Weiwei Xing, Zheng Wang, Zhanxing Zhu

机构 * Beijing Jiaotong University(北京交通大学) AntGroup(蚂蚁集团) Northwestern Polytechnical University(西北工业大学) University of Leeds(利兹大学) University of Southampton(南安普顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文通过难度维度和单样本分析,发现样本难度对RLVR有非单调影响,中等难度问题提供最稳定的推理改进,并基于此提出难度自适应策略。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28065 2026-05-28 cs.AI 57%

Verifiable Benchmarking of Long-Horizon Spatial Biology

长程空间生物学的可验证基准测试

Ian Diks, Harihara Muralidharan, Tim Proctor, Kenny Workman

机构 * LatchBio

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出 SpatialBench-Long 基准,通过 24 个评估任务测试 AI 代理从原始空间数据中推导科学结论的能力,发现当前最佳模型仅达到 11.1% 的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28047 2026-05-28 cs.CL 57%

Knowledge Dependency Estimation for Reliable Question Answering

面向可靠问答的知识依赖估计

Chaodong Tong, Qi Zhang, Nannan Sun, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) China Industrial Control Systems Cyber Emergency Response Team(中国工业控制系统网络应急响应团队)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出Knot方法,通过子集级反事实监督和潜在依赖因子覆盖建模,估计黑盒问答模型对不同知识单元的敏感性,以识别关键知识依赖。

Comments 12 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15864 2026-05-28 cs.CV cs.CL 57%

Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination

VLMs 是在看还是只是在说?揭示视觉重新检查的幻觉

Chufan Shi, Cheng Yang, Yaokang Wu, Linghao Jin, Bo Shui, Taylor Berg-Kirkpatrick, Xuezhe Ma

机构 * University of Southern California(南加州大学) University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 通过图像交换探测框架 VisualSwap 和 800 对图像基准 VS-Bench,发现视觉语言模型在推理时声称的“重新检查图像”多为文本模式,而非真正的视觉重新检查,且思考模型更易受影响,用户指令可恢复视觉基础但自我反思无效。

Comments ICML 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11896 2026-05-28 cs.CR cs.AI cs.SE 57%

VULPO: Context-Aware Vulnerability Detection via On-Policy LLM Optimization

VULPO:基于策略优化的上下文感知漏洞检测

Youpeng Li, Fuxun Yu, Weiliang Qi, Xinda Wang

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Microsoft(微软)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出VULPO框架,通过构建包含上下文信息和推理轨迹的数据集ContextVul,结合冷启动监督微调和自适应策略优化,显著提升大语言模型在真实仓库中的漏洞检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22655 2026-05-28 cs.AI cs.CV cs.MM 57%

Text-Only Data Synthesis for Vision Language Model Training

仅文本数据合成用于视觉语言模型训练

Xiaomin Yu, Wenjie Zhang, Ziyue Qiao, Chengwei Qin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Great Bay University(大湾大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出一个跨集成的三阶段多模态数据合成框架,仅从文本生成高质量多模态训练数据,用于视觉语言模型的预训练和指令微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26546 2026-05-27 cs.AI 57%

MobileExplorer: Accelerating On-Device Inference for Mobile GUI Agents via Online Exploration

MobileExplorer: 通过在线探索加速移动GUI代理的端侧推理

Runxi Huang, Liyu Zhang, Shengzhong Liu, Xiaomin Ouyang

机构 * Hong Kong University of Science and Technology(香港理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出MobileExplorer框架,通过在线探索并行探测UI元素并记录为结构化记忆,结合两级回滚机制,减少推理步骤和延迟,提升移动GUI代理的端侧部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26246 2026-05-27 cs.LG 57%

The Bridge-Garden Dilemma in LLM Distillation: Why Mixing Hard and Soft Labels Works

LLM蒸馏中的桥园困境:为什么混合硬标签和软标签有效

Guanghui Wang, Kaiwen Lv Kacuila, Zhiyong Yang, Zitai Wang, Jin-Wen Wu, Longtao Huang, Qianqian Xu, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学计算机科学与技术学院) Alibaba Group, Hangzhou, China(阿里巴巴集团) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) Key Laboratory of Big Data Mining and Knowledge Management (BDKM), University of Chinese Academy of Sciences, Beijing, China(中国科学院大数据挖掘与知识管理重点实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 针对大语言模型知识蒸馏中硬标签与软标签的混合使用,提出桥园分解理论解释其降低暴露偏差的机制,并开发自适应混合监督方法,在多个模型上实现性能提升和9.7倍训练成本降低。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20291 2026-05-27 cs.LG 57%

Weasel: Out-of-Domain Generalization for Web Agents via Importance-Diversity Data Selection

Weasel: 通过重要性-多样性数据选择实现Web智能体的域外泛化

Fatemeh Pesaran Zadeh, Seyeon Choi, Xing Han Lù, Siva Reddy, Gunhee Kim

机构 * Seoul National University(首尔国立大学) McGill University(麦吉尔大学) Mila -- Quebec AI Institute(蒙特利尔AI研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 提出Weasel方法,通过优化平衡单步重要性与状态、网站、交互模式成对多样性的目标,选择固定预算的轨迹子集,结合目标中心AXTree剪枝和风格一致理由替换,提升Web智能体离线训练的域外泛化性能并降低训练成本。

Comments ICML 2026. Code is released at https://github.com/fatemehpesaran310/weasel

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17617 2026-05-27 cs.AI 57%

GraphMind: From Operational Traces to Self-Evolving Workflow Automation

GraphMind:从操作轨迹到自演化工作流自动化

Yiwen Zhu, Joyce Cahoon, Anna Pavlenko, Qiushi Bai, Nima Shahbazi, Divya Vermareddy, Meina Wang, Mathieu Demarne, Swati Bararia, Wenjing Wang, Hemkesh Vijaya Kumar, Hannah Lerner, Katherine Lin, Steve Toscano, Miso Cilimdzic, Subru Krishnan

机构 * Microsoft, USA University of Illinois Chicago, USA Microsoft, Spain

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出GraphMind系统,通过离线提取因果工作流图、在线多智能体遍历执行和自适应遍历强化,实现云数据库事故调查中的自动化工作流,相比基线方法减少8倍检索上下文并降低26%幻觉率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25534 2026-05-26 cs.AI 57%

StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMs

StructBreak: 多模态大语言模型中结构性认知过载引发的安全故障

Yang Luo, Xinran Liu, Tiantian Ji, Zhiyi Yin, Lingyun Peng, Shuyu Li

机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE), Beijing University of Posts and Telecommunications(可信分布式计算与服务重点实验室(MoE),北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出StructBreak框架,通过量化结构性认知过载(SCO)揭示一种高阶认知过载攻击范式,在六种主流MLLM上实现92%平均攻击成功率,并证明该攻击通过结构性通道绕过安全过滤器。

Comments 23 pages; accepted to Findings of ACL 2026. This paper contains examples of harmful content

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25435 2026-05-26 cs.AI 57%

Security of OpenClaw Agents: Fundamentals, Attacks, and Countermeasures

OpenClaw 代理的安全性:基础、攻击与对策

Yuntao Wang, Jianle Ba, Han Liu, Yanghe Pan, Jintao Wei, Zhou Su, Tom H. Luan, Linkang Du

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(西安交通大学网络科学与工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了 OpenClaw 代理的安全挑战,分类分析了技能投毒、认知操纵、多代理级联故障和供应链漏洞等威胁,并总结了现有防御机制。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25389 2026-05-26 cs.CR cs.AI cs.MA 57%

Evo-Attacker: Memory-Augmented Reinforcement Learning for Long-Horizon Tool Attacks on LLM-MAS

Evo-Attacker: 用于LLM-MAS长时程工具攻击的记忆增强强化学习

Bingyu Yan, Xiaoming Zhang, Jinyu Hou, Chaozhuo Li, Ziyi Zhou, Yiming Hei, Litian Zhang

机构 * Beihang University(北航) Beijing University of Posts and Telecommunications(北京邮电大学) China Academy of Information and Communications Technology(信息通信技术研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出Evo-Attacker,通过记忆增强强化学习框架将工具攻击建模为自进化过程,并引入Attack-Flow GRPO优化长时程信用分配,实验表明其优于基线方法。

Comments ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24869 2026-05-26 cs.CL 57%

Lngram: N-gram Conditional Memory in Latent Space

Lngram: 潜在空间中的N-gram条件记忆

Yunao Zheng, Guoyang Xia, Xiaojie Wang, Lei Ren

机构 * Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学) Li Auto Inc.(Li Auto公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出Lngram,一种在潜在空间中学习离散符号并执行N-gram查找的条件记忆模块,以解耦检索与骨干网络,提升长上下文语言建模和跨模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24675 2026-05-26 cs.CV cs.AI 57%

VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation

VaaWIT: 面向多语言网页图像翻译的大语言模型视觉感知适配

Bo Li, Ronghao Chen, Ningyuan Deng, Huacan Wang, Shaolin Zhu, Lijie Wen

机构 * The Hong Kong University of Science(香港科技大学) Tianjin University(天津大学) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对网页图像翻译中视觉表示差距问题,提出VaaWIT框架,通过双流注意力模块和视觉感知适配器,实现大语言模型对细粒度视觉特征的动态融合,在多个基准上超越开源模型并接近闭源模型性能。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏