arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 7434 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 2137 篇

2607.18142 2026-07-21 cs.CV cs.AI cs.CL cs.MA 新提交 62%

O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

O-VAD:通过以对象为中心的跟踪和推理进行工业视频异常检测

Mei Yuan, Qi Long, Qifeng Wu, Zhenyang Li, Yizhou Zhao, Lei Wang, Yang Liu, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Griffith University(格里菲斯大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 针对工业视频异常检测,现有基于VLM的方法在工业场景中性能不佳的问题,提出无训练的智能框架O-VAD,通过跟踪对象时空动态和推理状态轨迹来检测异常,在多数据集实验中优于多种方法且能提供可解释报告。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17935 2026-07-21 cs.CL cs.AI 新提交 62%

DeLIVeR: Decomposed Learning for Information-grounded Veracity Recognition via Reinforced Knowledge Graph Exploration

DeLIVeR:通过强化知识图谱探索进行基于信息的真实性识别的分解学习

Cong Hoan Nguyen, Thomas Hoang, Hieu Minh Duong, Long Nguyen

机构 * University of Louisville(路易斯维尔大学) Denison University(丹尼森大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 针对大语言模型自动事实核查难题,DeLIVeR框架将证据检索设为强化探索任务,利用规划器大语言模型分解声明获问题集遍历知识图谱找证据,经GRPO优化策略,实验表明其显著优于基线,有效弥合推理差距,提供检测路径。

Comments Accepted to 7th International Conference on Deep Learning Theory and Applications (DeLTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17317 2026-07-21 cs.LG cs.AI 新提交 62%

TAPAS: Throughput-adaptive Perception for Autonomous Systems

TAPAS:自主系统的吞吐量自适应感知

Aman Vyas, Vasista Kodumagulla, Zain Taufique, Pasi Liljeberg, Anil Kanduri

机构 * University of Turku(图尔库大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对自主系统感知模块吞吐量需求随场景变化的问题,提出基于强化学习的吞吐量自适应感知策略TAPAS,能在异构移动/边缘平台智能分配资源,在KITTI和nuScenes数据集上评估,吞吐量满足率高且节能效果显著。

Comments 15 Pages, 20 Figures, Accepted at ACM/IEEE International Conference on Codesign of Embedded Systems at Embedded Systems Week (ESWEEK-CODES), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17281 2026-07-21 cs.LG cs.AI 新提交 62%

AIGB-R1: Self-Evolving Generative Auto-Bidding via Hierarchical Planner-Executor Optimization

AIGB-R1:通过分层规划器-执行器优化实现自我进化的生成式自动出价

Yuejia Dou, Hesong Wang, Xinyu Zhang, Tianyu Wang, Zhilin Zhang, Chuan Yu, Jian Xu, Bo Zheng, Qi Qi

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Alibaba Group(阿里巴巴集团)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对AIGB范式在自动出价中存在的问题,提出AIGB-R1框架,利用大语言模型推理能力,通过分层规划器与执行器模块、经验驱动循环、两阶段训练及新优化方法,经实验验证该框架在自动出价任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16938 2026-07-21 cs.CV cs.AI cs.LG cs.RO 新提交 62%

What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning

他们看到了什么?通过视觉-语言-动作模型的视角解读复杂道路场景以实现安全可靠的自动驾驶学习

Kalpana Panda, Wesley Maia, Vinti Agarwal, Ross Greer

机构 * Birla Institute of Technology and Science, Pilani(贝拉理工科学学院皮拉尼分校) University of California, Merced(加州大学默塞德分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究自动驾驶模型内部逻辑不透明问题,提出反事实消融框架CVAA,通过移除摄像头图像中物体创建反事实集评估模型响应差异,应用于阿尔帕马约1轨迹预测器,分析物体因果影响,还通过可解释性技术深入理解模型,创建可解释驾驶系统巩固人机信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16591 2026-07-21 cs.LG cs.AI 新提交 62%

Learning from World Feedback: Why Model Uncertainty Fails as a Risk Signal in Model-Based RL

从世界反馈中学习:为何模型不确定性在基于模型的强化学习中无法作为风险信号

Zhaohui Wang

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨 RLxF 中学习信号应源于世界反馈,在安全模型控制中实例化并提炼原则。通过实验表明基于动力学的不确定性惩罚会增加碰撞率,用世界反馈信号可降低碰撞率,提取原则并指出其适用于多种相关方法。

Comments Accepted at the ICML 2026 Workshop on Reinforcement Learning from X Feedback (RLxF). 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15552 2026-07-20 cs.LG cs.AI 新提交 62%

From Feasibility to Desirability: Plan, Learn, Adapt (PLA) Framework for Personalized On-Device Itinerary Generation

从可行性到合意性:用于个性化设备端行程生成的计划、学习、适应(PLA)框架

Himel Dev, Tanmoy Sen, Madhusudan Basak, Bashima Islam

机构 * Tech LLC(529科技有限责任公司) University of Virginia(弗吉尼亚大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对个性化设备端行程生成问题,提出PLA框架,分计划、学习、适应三阶段,通过构建规划器集合、拟合奖励模型及进行局部优化来生成行程,实验表明该框架在可行性和胜率上表现出色,还提升了生产部署中的行程完成率并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15524 2026-07-20 cs.LG cs.AI 新提交 62%

Recursive Harness Self-Improvement

递归工具自我改进

Hyunin Lee, Jinglue Xu, Jeffrey Seely, Donghyun Lee, Matei Zaharia, Yujin Tang

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究在模型-工具协同进化中,通过递归工具自我改进(RHI)优化用户构建工具,以提高执行轨迹质量和智能体性能。RHI将工具表示为提示级规范,经成对反馈迭代改进,在多任务中提升了低推理能力智能体性能,降低推理成本。

Comments This work addresses the first half of the model-harness coevolution loop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14127 2026-07-17 cs.LG cs.AI cs.ET 新提交 62%

Explainable Geospatial AI for Satellite Ground Station Siting Using LiDAR-Derived Terrain Intelligence

利用激光雷达衍生地形智能的卫星地面站选址可解释地理空间人工智能

Shohini Sarkar, Smithi Mahendran, Rishi Chudasama, Varun Mannam, Arav Luthra, Yuvraj Rekhi, Vivek Nadig, Arsh Goenka

机构 * U.S. Geological Survey(美国地质调查局)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究利用激光雷达衍生地形智能预测卫星地面站选址的代表性杂波高度,提出可解释机器学习框架,用多种数据训练,选LightGBM,模型误差降低超60%,评估相关标准,SHAP识别关键预测因子,证明开放数据可改善杂波建模。

Comments Accepted at the 2026 IEEE 22nd International Conference on Automation Science and Engineering (IEEE CASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12631 2026-07-15 cs.CL cs.AI 新提交 62%

Can Induced Emotion Bias LLM Behaviors in Sequential Decision Making?

诱导情绪会影响大语言模型在序列决策中的行为吗?

Minh Khoi Ho, Zihao Zhu, Runchuan Zhu, Levina Li, Zhiwen Fan, Zhangyang Wang, Junyuan Hong

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Texas A&M University(德州农工大学) National University of Singapore(新加坡国立大学) UCLA(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) Mass General Hospital(麻省总医院) Harvard Medical School(哈佛医学院)

专题命中 规划决策 :autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 研究探讨诱导情绪对大语言模型在序列决策中行为的影响,采用爱荷华赌博任务结合情绪诱导程序,发现诱导情绪平均不显著影响其决策动态,但愤怒有条件地影响决策,揭示了与人类行为的差异,为相关研究提供工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12111 2026-07-15 cs.LG cs.AI cs.DC cs.MA cs.NI 新提交 62%

PFAdapter: Hierarchical LoRA Decomposition for Personalized Federated MLLMs

PFAdapter:用于个性化联邦多模态大语言模型的分层LoRA分解

Jing Liu, Kun Yang, Yan Wang, Dingkang Yang, Xiaoshuai Hao, Wei Zhang, Yang Liu, Wei Zhou

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) Division of Natural and Applied Sciences, Duke Kunshan University(昆山杜克大学自然科学与应用科学部) Department of Electrical and Computer Engineering, The University of British Columbia(英属哥伦比亚大学电气与计算机工程系) Ant Group(蚂蚁集团) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University & Fysics AI(复旦大学智能机器人与先进制造学院及复肆智能科技(上海)有限公司) Xiaomi EV, Xiaomi Campus(小米汽车、小米园区) Information and Communications Technology Cluster, Singapore Institute of Technology (SIT)(新加坡理工学院信息通信技术集群) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对分布式网络中联邦微调平衡全局知识与局部适应的挑战,提出PFAdapter框架,用分层LoRA分解将适配器参数分离,通过正交正则化和选择性聚合协议减少通信成本,实验证明该框架在多数据集上性能优于基线,为智能AI部署提供有效方案。

Comments submitted to IEEE TCCN

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11053 2026-07-14 cs.CL cs.AI 新提交 62%

Flout at Your Own Risk: LLMs Struggle with Pragmatic Cooperativity Under Epistemic Asymmetry

自担风险:在认知不对称下大语言模型在语用合作方面存在困难

Hannah VanderHoeven, Abhijnan Nath, Nikhil Krishnaswamy

机构 * Situated Grounding and Natural Language (SIGNAL) Lab(情境基础与自然语言(SIGNAL)实验室)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究大语言模型在多方协作任务部分信息条件下的语用推理能力,形式化协作认知不对称概念,评估其作为说话者和倾听者合作能力,发现虽有一定语用能力但信息不完整时仍有挑战,部分失败模式与格赖斯准则违反有关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09623 2026-07-13 cs.CL cs.AI 新提交 62%

Task-Specific Multimodal Question Answering Agents via Confidence Calibration and Incremental Reasoning for QANTA 2026

通过置信度校准和增量推理实现特定任务的多模态问答代理,用于QANTA 2026

Nirjhar Das, Md. Al-Mamun Provath

机构 * Department of Computer Science Engineering, Chittagong University of Engineering \& Technology, Chattogram, Bangladesh

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对QANTA 2026共享挑战,开发特定任务双代理架构,抢答代理用带置信度校准的模型及数值推理策略,加分代理用多种推理整合信息,强调仅托管环境下的高效推理与校准,系统取得高分,证明轻量级策略在资源受限问答中性能强。

Comments 10 pages, 1 figure. Accepted at the EMM-QA 2026 Workshop, ICML 2026 (Non-Archival). Rank #1 overall system in the QANTA 2026 Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07740 2026-07-13 cs.LG cs.AI 新提交 62%

Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE

Jet-Long:使用动态双焦点旋转位置编码的高效长上下文扩展

Haozhan Tang, Zerui Wang, Yuxian Gu, Song Han, Han Cai

机构 * NVIDIA(英伟达)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究针对现代语言模型长上下文应用中零样本上下文扩展问题,提出Jet-Long方法,通过动态双焦点RoPE及相关技术,在推理时开销小,在多种模型和基准测试中表现优异,还能推广到其他架构且超参数弹性强。

Comments added discussion of AdaGroPE and LaMPE (Findings of ACL 2026) with clarified contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08331 2026-07-10 cs.LG cs.AI 新提交 62%

ArtMine: Discovering and Formalizing Artistic Processes

ArtMine:发现并形式化艺术创作过程

Kaustubh Kumar, Ashutosh Ranjan, Vivek Srivastava, Blessin Varkey, Shirish Karande

机构 * TCS Research(TCS研究)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究如何从异构历史证据发现并形式化艺术创作过程,核心方法是将证据合成存储库,由溯因智能体推断生产步骤并优化,主要贡献是迈向以过程为中心的人机协同创作系统,支持多方面研究。

Comments 47 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26366 2026-07-10 cs.AI cs.CL cs.CY 新提交 62%

Narration-of-Thought: Inference-Time Scaffolding for Defeasible Ethical Reasoning in Large Language Models

思维叙述:大型语言模型中可废止伦理推理的推理时支架

Patrick Cooper, Alvaro Velasquez

机构 * Department of Computer Science(计算机科学系) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 针对道德困境中标准思维链的两种失败模式,提出思维叙述(NoT)系统提示,将思维链结构化为五个部分,无需训练即可大幅减少利益相关者崩溃和不确定性抑制,并通过消融实验和跨家族训练法官验证其有效性。

Comments 24 pages, 8 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07016 2026-07-09 cs.LG cs.AI 新提交 62%

Multimodal Spatiotemporal-Frequency Fusion with Peak Enhancement for Cellular Traffic Forecasting

用于蜂窝流量预测的具有峰值增强的多模态时空频率融合

Qingzhong Li, Yue Hu, Hui Ma, Yajun Zhang, Xinjun Pei, Ming Yan, Fei Xing

机构 * Xinjiang University(新疆大学) College of Geography and Remote Sensing Sciences, Xinjiang University(新疆大学地理与遥感科学学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对蜂窝网络流量预测难题,提出MSPF-Net框架,它集成外部上下文信息,含时空频率流量编码器、峰值增强模块等,能联合建模流量动态、突发模式和新闻上下文信号,实验证明可有效提升预测性能。

Comments Accepted in the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05339 2026-07-07 cs.LG cs.AI stat.ML 新提交 62%

TREK: Distill to Explore, Reinforce to Refine

TREK:蒸馏以探索,强化以优化

Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian Sang, Xiaomin Li, Wenhui Zhu, Xinchen Du, Aida Rahmattalabi, Ran He, Sen Na, Zhipeng Wang, Alborz Geramifard

机构 * LinkedIn Corporation(领英公司) Harvard University(哈佛大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO在学生策略覆盖外的难提示样本上失效问题,提出TREK方法,通过蒸馏扩展探索空间再结合GRPO优化,在多推理与智能体任务上大幅提升模型性能。

Comments 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05272 2026-07-07 cs.LG cs.AI cs.DC cs.PF 新提交 62%

Adaptive Inference Batching using Policy Gradients

基于策略梯度的自适应推理批处理

Ruslan Sharifullin

机构 * NVIDIA Corporation(英伟达公司)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对突发异构负载下推理服务的调度难题,采用强化学习学习自适应批处理路由策略,在多GPU场景下消除队头阻塞,性能远超传统启发式方法。

Comments 5 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04541 2026-07-07 cs.CV cs.AI cs.LG cs.RO 新提交 62%

CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining

CRISP:一种通过基于预测的世界模型预训练实现驾驶的时空相机-雷达主干网络

Jingyu Song, Yi Liu, Katherine A. Skinner

机构 * Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过基于预测的表示学习预训练时空相机-雷达主干网络CRISP,利用历史多视图图像和雷达扫描,通过预测未来激光雷达点云学习统一鸟瞰图表示,介绍相关组件,实验表明其能提升点云预测并有效迁移至下游任务。

Comments 17 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03386 2026-07-07 cs.AI cs.LG 新提交 62%

When Aggregate Alignment Misleads: Auditing Policy Repair Without Per-State Expert Actions

当聚合对齐产生误导时:无需逐状态专家操作的审核策略修复

Peiying Zhu, Sidi Chang

机构 * Blossom AI(绽放人工智能公司) Blossom AI Labs(绽放人工智能实验室)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究在酒店定价模拟器中,智能策略编辑器仅接收区域级诊断反馈时的策略修复问题,用多重启大语言模型编辑器进行修复,其不仅提升收益还减小情节构成距离,结果表明应按诊断反馈是否成可靠闭环结果评估策略修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03190 2026-07-07 cs.LG cs.AI 新提交 62%

A Bayesian Framework for Evaluating Scenario Compatibility in Generative Population Synthesis

用于评估生成性人口合成中情景兼容性的贝叶斯框架

Zhenlin Qin, Leizhen Wang, Yancheng Ling, Zhenliang Ma

机构 * Department of Civil and Architectural Engineering, KTH Royal Institute of Technology, Stockholm, Sweden(瑞典皇家理工学院土木与建筑工程系,瑞典斯德哥尔摩) Digital Futures, KTH Royal Institute of Technology, Stockholm, Sweden(瑞典皇家理工学院数字未来中心,瑞典斯德哥尔摩) Department of Data Science and Artificial Intelligence, Monash University, Melbourne, Australia(澳大利亚莫纳什大学数据科学与人工智能系,澳大利亚墨尔本)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究情景目标与生成模型的兼容性问题,提出基于集成的贝叶斯更新框架,通过人口感知条件变分自编码器学习分布,用有效样本量量化兼容性,为情景可行性和结构一致性评估提供诊断模型。

Comments Accepted for publication in the Proceedings of the 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03065 2026-07-07 cs.LG cs.AI 新提交 62%

Spectral Rewiring for Exploration, Purification, and Model Merging

用于探索、提纯和模型合并的频谱重布线

Zhilong Zhang, Hongli Yu, Huan-ang Gao, Hanlin Wu, Yuxuan Song, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

机构 * SIA-Lab of Tsinghua AIR(清华-字节跳动联合研究中心SIA实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究强化学习中参数更新瓶颈,提出子空间对齐重布线方法,保留频谱核心去除正交分量,可提纯训练更新、实现模型合并,提升推理和跨域性能,是无训练机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02944 2026-07-07 cs.LG cs.AI 新提交 62%

A Precedent-Guided Co-Scientist for Side-Effect-Aware Drug Redesign

一种用于副作用感知药物重新设计的先例引导协同科学家

Yujin Kim, Charmgil Hong

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出PRECEDE用于副作用感知药物重新设计,将重新设计视为基于证据的推理,由LLM编排,定位为人监督的科学工作流,可审核、证伪且受先前药理学限制。

Comments Accepted at the ICML 2026 Workshop on AI for Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09348 2026-07-07 cs.LG cs.CL 新提交 62%

PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment

PBSD: 特权贝叶斯自蒸馏用于长程信用分配

Yang Tian, Rui Wang, Xumeng Wen, Junjie Li, Shizhao Sun, Lei Song, Jiang Bian, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) XYZ AI Lab(XYZ AI实验室)

专题命中 规划决策 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 提出PBSD方法,通过贝叶斯校准的自蒸馏将稀疏最终奖励转化为细粒度步骤级信用信号,解决长程智能体任务中的信用分配问题,实验表明其提升领域内外性能并促进泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02504 2026-07-03 cs.CL cs.AI cs.CV 新提交 62%

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

推理大模型提升长篇电视剧中的说话人识别

Yuxuan Li, Lingxi Xie, Xinyue Huo, Jihao Qiu, Jiacheng Shao, Pengfei Chen, Jiannan Ge, Kaiwen Duan, Qi Tian

专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.CL

AI总结 提出DramaSR-532K大规模基准和基于推理大模型的DramaSR-LRM方法,通过多模态工具使用聚合上下文证据,显著提升长篇电视剧中说话人识别准确率,尤其对短话语效果显著。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02255 2026-07-03 cs.AI cs.CL 新提交 62%

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

AgenticSTS: 一种用于长周期LLM智能体的有界记忆测试平台

Xiangchen Cheng, Yunwei Jiang, Jianwen Sun, Zizhen Li, Chuanhao Li, Xiangcheng Cao, Yihao Liu, Fanrui Zhang, Li Jin, Kaipeng Zhang

机构 * Alaya Lab(Alaya实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出一种有界记忆契约,通过类型化检索组装用户消息,避免原始跨决策转录,在《杀戮尖塔2》中实现并验证,揭示了战略技能层对胜率的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01595 2026-07-03 cs.AI cs.CL 新提交 62%

Safe and Adaptive Cloud Healing: Verifying LLM-Generated Recovery Plans with a Neural-Symbolic World Model

安全且自适应的云修复:使用神经符号世界模型验证LLM生成的恢复计划

Junyan Tan, Haoran Lin, Siyuan Guo, Yichen Fang, Xinyue Luo, Tianyu Shen, Zeyu Qiao

机构 * Zhejiang University(浙江大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 提出PASE框架,将LLM作为规划引擎生成恢复计划,通过神经符号世界模型验证可行性,并利用DRL优化提示,实现动态自适应修复,显著降低恢复时间并提高未知故障检测精度。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01232 2026-07-03 cs.LG cs.CL 新提交 62%

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

一层就够了吗?训练单个Transformer层可以匹配全参数RL训练

Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Peking University(北京大学) Amazon(亚马逊)

专题命中 规划决策 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 发现RL训练收益高度集中在少数Transformer层,仅训练单层即可恢复大部分全参数RL收益,且高贡献层集中在模型中部。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00917 2026-07-02 cs.LG cs.AI 新提交 62%

Valdi: Value Diffusion World Models

Valdi: 价值扩散世界模型

Christopher Lindenberg, Kashyap Chitta

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出Valdi框架,结合端到端在线训练与潜在扩散动力学模型,在CarRacing环境中使用单步扩散达到与确定性MLP基线相当的性能,揭示了预测多模态与控制性能之间的权衡。

Comments RLC 2026 WMW

详情

展开后加载摘要…

URL PDF HTML 收藏