arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-31 至 2026-08-31 共收录 346 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 15 篇

2608.28421 2026-08-31 cs.AI 新提交 79%

Program Learning with Verifiable Rewards: Symbolic Backpropagation for Post-Training LLMs

可验证奖励的程序学习:针对后训练大语言模型的符号反向传播

Vishvesh Bhat

机构 * CoreThink AI

专题命中 后训练与偏好优化 :post-training(title);language model(abstract);分类 cs.AI

AI总结 本文提出PLVR方法,通过符号反向传播从输入输出示例学习显式程序,在代码基准上提升大语言模型推理能力,边际成本低且效果优于RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28406 2026-08-31 cs.CV cs.LG 新提交 79%

Post-Training VLMs for Video Mistake Detection

用于视频错误检测的后训练视觉语言模型

Federico Spurio, Olga Zatsarynna, Lars Doorenbos, Emad Bahrami, Gianpiero Francesca, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Toyota Motor Europe Belgium(丰田汽车欧洲比利时公司)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 针对视频错误检测的闭集方法泛化性差的问题,提出首个VLM后训练技术,采用定制奖励函数,在EP-VQA上较最佳基线提升11.6%,实现更好的泛化。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09467 2026-08-31 cs.CV cs.AI 版本更新 79%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28264 2026-08-31 cs.AI 新提交 70%

Finding Where the Buck Stops: An Automated Failure Attribution-Based Reflection Framework for Multi-Agent Collaboration

查明责任归属:面向多智能体协作的自动化失败归因式自动反思框架

Xiaoqing Wang, Keman Huang, Bin Liang, Hongyu Li, Xiaoyong Du, Wuqiong Pan

机构 * Renmin University of China(中国人民大学) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对大语言模型驱动多智能体系统的高失败率问题,提出DoCtOR框架,通过自动化失败归因识别决定性错误智能体,仅让其针对性反思,在多个数据集上提升成功率且优于基线方法。

Comments Accepted by EMNLP 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27017 2026-08-31 cs.IR 版本更新 67%

ProRetrieval: Learning to Orchestrate Hybrid Search via Executable Program Synthesis

ProRetrieval:通过可执行程序合成学习编排混合搜索

Chengsong You, Zhen Sun, Yunhai Hu, Junwei Zhou, Xiaoyu Cao, Binyu Li, Ziyan Zhao, Weiyao Wang, Liren Lu, Zhijie Ye, Yumo Cao, Yitao Long, Yiwei Xu, Qiyi Jiang, Xuanyi Fu, Yufan Chen, Yilun Li, Rongkang Xiong, Yiran Zou, Nan Du

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract)

AI总结 ProRetrieval 将语言模型作为检索编排器,通过混合 DSL 合成可执行程序,在两个新基准上训练 Qwen3-4B,其 4B 模型在电商、邮件检索任务中优于 GPT-5.5 等主流模型及各类基线。

Comments 15 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21240 2026-08-31 cs.LG 版本更新 57%

Class Incremental Continual Learning with Self-Organizing Maps and Synthetic Replay

基于自组织映射和合成重放的类别增量持续学习

Pujan Thapa, Alexander Ororbia, Travis Desell

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 该研究提出基于自组织映射(SOM)与合成重放的类别增量持续学习框架,在多基准数据集上性能优于无内存方法,为类别增量持续学习提供了可扩展的无标签无示例方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 22 篇

2608.28048 2026-08-31 cs.AR cs.DC 新提交 90%

AI Hardware Accelerators for Large Language Models: Architectures and the Memory Wall

面向大语言模型的AI硬件加速器:架构与内存墙

Siddharth Patel, Rohit Singh

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本综述梳理了各类面向大语言模型的AI硬件加速器架构,基于Transformer与Roofline分析指出内存是加速核心约束,对比各平台特性并展望了未来以内存为中心的异构系统发展方向。

Comments Review/survey article on AI hardware accelerators for large language models; compares GPUs, ASICs, FPGAs, processing-in-memory/near-memory, neuromorphic, and photonic architectures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17016 2026-08-31 cs.CL cs.AI cs.LG cs.MA 版本更新 90%

TokenPilot: Cache-Efficient Context Management for LLM Agents

TokenPilot: 面向LLM智能体的缓存高效上下文管理

Buqiang Xu, Zirui Xue, Dianmou Chen, Chenyang Fu, Chiyu Wu, Caiying Huang, Chen Jiang, Jizhan Fang, Xinle Deng, Yijun Chen, Yunzhi Yao, Xuehai Wang, Jin Shang, Gong Yu, Ningyu Zhang

机构 * Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Xi’an University of Electronic Science and Technology(西安电子科技大学) HomologyAI(同源人工智能)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM智能体长会话中上下文累积导致推理成本高的问题,提出TokenPilot双粒度上下文管理框架,通过摄入感知压缩和生命周期感知驱逐策略,在保持性能的同时降低61%-87%的成本。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13574 2026-08-31 cs.AI cs.MA 版本更新 85%

Agentao: A Policy-Governed Runtime Harness for Embeddable Tool-Using LLM Agents

Agentao:面向使用工具的大语言模型智能体的受管控本地优先运行时

Bo Jin, Qiang Jiao, Xin Tong

机构 * The Third Research Institute of the Ministry of Public Security(公安部第三研究所) Bureau of Science and Technology Information Ministry of Public Security of the People’s Republic of China(中华人民共和国公安部科技信息局) School of Information and Cyber Security People’s Public Security University of China(中国人民公安大学信息与网络安全学院)

专题命中 长上下文与记忆 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对工具使用型LLM智能体的安全管控需求,提出Agentao运行时,通过分层架构分离动作提案与授权执行,将权限等构建为显式抽象,提升智能体可管控性与可检查性。

Comments The code is publicly available at Github. We are conducting testing and analysis of this framework, and will provide experimental results and examples in future versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26152 2026-08-31 cs.CL cs.AI cs.HC 版本更新 85%

AI Models Can Predict and Collaboratively Modulate Human Memory Search

人工智能模型可预测并协同调节人类的记忆搜索

Eric Lacosse, Mariana Duarte, Graham Todd, Peter M. Todd, Daniel C. McNamee

机构 * Champalimaud Research(尚帕利莫德研究院) Champalimaud Centre for Restorative Neurotechnology(尚帕利莫德修复神经技术中心) New York University Tandon(纽约大学坦登工程学院) Indiana University(印第安纳大学)

专题命中 长上下文与记忆 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 该研究探索LLMs在语义记忆搜索中追踪增强人类心理轨迹的能力,通过语义流畅性任务验证,发现LLMs追踪预测人类记忆轨迹的能力优于其他人类。

Comments 18 pages, 5 figures; includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27580 2026-08-31 cs.AI 新提交 84%

LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails

LongGuard:针对安全护栏长上下文失效的机制分析与无训练缓解方案

Ziyang Chen, Xing Wu, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对LLM安全护栏在长上下文下的失效问题,提出LongGuard框架,经机制分析后开发无训练缓解方案,在多基准测试中实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22849 2026-08-31 cs.LG q-bio.GN 版本更新 83%

RIBOSPAN: A Long-Context RNA Foundation Model for Versatile RNA Modeling

RIBOSPAN:用于多功能RNA建模的长上下文RNA基础模型

Ziyuan Wang, Bohao Tang, Fei Zhang, Shuo Han, Pengfei Liu

机构 * Shanghai Innovation Institute(上海创新研究院) Center for Excellence in Molecular Cell Science, CAS(中国科学院分子细胞科学卓越创新中心) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究提出支持10240nt上下文的长RNA基础模型RIBOSPAN,结合多种技术实现高分辨率长RNA建模,在多任务评估中达最优性能,并开发基于其主干的mRNA生成与优化框架。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26403 2026-08-31 cs.CL 版本更新 83%

ProfileFoundry: A Synthetic Person-Object Substrate for Privacy, Memory, and Tool-Use Evaluation in LLM Agent

ProfileFoundry: 用于LLM智能体隐私、记忆和工具使用评估的合成人物-对象基底

Sriram Selvam, Anneswa Ghosh

机构 * NVIDIA Corporation(英伟达公司)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL

AI总结 提出ProfileFoundry,一个确定性生成器,发布10万个合成成人人物对象,包含快照、家庭、雇主等字段及事件、关系边,用于下游基础模型评估中的记忆、隐私等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27856 2026-08-31 cs.LG cs.AI cs.MA 新提交 82%

FedEHR-Agents: Federated Agentic Optimization for Automated EHR Modeling

FedEHR-Agents:面向自动化电子健康记录(EHR)建模的联邦智能体优化框架

Jun Bai, Ruilin Wang, Yue Li

机构 * School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对医院EHR数据隐私与协作局限,提出以经验为中心的FedEHR-Agents框架,通过联邦智能体聚合建模经验,在多医院EHR基准上的临床预测任务中表现优于基线方法。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07809 2026-08-31 cs.LG cs.AI 版本更新 82%

PolicyLong: Towards On-Policy Context Extension

PolicyLong:迈向基于策略的上下文扩展

Junlong Jia, Jiang Zhou, Ziyang Chen, Xing Wu, Chaochen Gao, TingHao Yu, Feng Zhang, Songlin Hu

机构 * Hunyuan Team, Tencent(腾讯混元团队) Chinese Academy of Sciences(中国科学院)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 PolicyLong通过动态在线策略方法解决LLM上下文扩展中的数据稀缺问题,通过迭代重新执行数据筛选,确保训练分布与模型能力同步,提升长上下文性能。

Comments Work in progress. Correspondence to ucaswu@tencent.com or wuxing@iie. this http URL (http://ac.cn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23271 2026-08-31 cs.CL 版本更新 81%

Learning a Single Token to Replace Long System Prompts in LLMs

行为等效标记:用于LLMs长提示的单标记替代

Jiancheng Dong, Pengyue Jia, Jingyu Peng, Maolin Wang, Yuhao Wang, Lixin Su, Xin Sun, Shuaiqiang Wang, Dawei Yin, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Baidu Inc.(百度公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种轻量级框架,通过学习单个行为等效标记替代长提示,实现提示长度减少3000倍并保持98%的下游性能。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27981 2026-08-31 cs.CR cs.SE 新提交 80%

CHISEL-ing Back Source Code with AI-enabled Iterative Recovery

利用AI驱动的迭代恢复技术“CHISEL”重构源代码

Varun Kohli, N Raghava, Biplab Sikdar, Dinil Mon Divakaran

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 本研究提出无需测试套件的CHISEL框架,结合编译器与模糊测试工具反馈,利用Gemma4:31b LLM从Ghidra伪代码迭代恢复源代码,在120个ExeBench函数上实现高可编译性与可执行率,性能优于现有方法。

Comments Accepted for publication in ACM CCS SURE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28444 2026-08-31 cs.CL cs.LG 新提交 79%

Sliding-window beats linear attention

滑动窗口注意力优于线性注意力

Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais

机构 * Microsoft(微软公司) Applied Sciences Group (ASG)(应用科学集团(ASG))

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本研究对比发现,带汇点的滑动窗口注意力(SWA)性能优于后训练的线性注意力模型,在长上下文推理任务中性能高2-10倍,且无需后训练、成本低,推荐用SWA替代线性注意力模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28502 2026-08-31 cs.CR 新提交 78%

Recognition Without Enforcement: Configuration-Dependent Failures in LLM Agent Instruction Arbitration and External Control

无执行的识别:大语言模型智能体指令仲裁与外部控制中依赖配置的失效

Jun Wen Leong

专题命中 长上下文与记忆 :LLM(title,abstract)

AI总结 本研究发现大语言模型智能体存在指令仲裁的识别-执行缺口,提出外部参考监控器实现安全控制,证明安全智能体需外部执行而非仅依赖识别。

Comments 81 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28476 2026-08-31 cs.CL 新提交 77%

ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL

ContextPilot:通过细粒度强化学习为智能体教授主动上下文管理

Zhuoshi Pan, Qizhi Pei, Junru Lu, Honglin Lin, H. Vicky Zhao, Di Yin, Xing Sun

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shanghai AI Lab(上海人工智能实验室)

专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对现有主动上下文管理方法的局限,提出ContextPilot框架,通过扩充工具集并设计细粒度RL方法,在长程智能体任务中实现更紧凑上下文下的更优性能,优于现有基线。

Comments 10 pages, 6 figures, 5 tables, accepted to EMNLP 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27809 2026-08-31 cs.IR 新提交 75%

LINE Conversation History Retrieval for Personal Memory RAG: Evaluating Search Representations and Hybrid Retrieval

用于个人记忆检索增强生成(RAG)的LINE对话历史检索:评估搜索表示与混合检索

Akito Hattori

专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对一名用户的LINE对话历史开展检索增强生成的初始案例,构建三种搜索表示并对比多种检索方法,发现特定混合检索配置在100个评估问题上的检索性能最优,但研究存在单用户单标注等局限性。

Comments 16 pages, 6 figures, 10 tables. Exploratory single-user case study

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12015 2026-08-31 cs.CR cs.AI cs.CL cs.LG cs.MA 版本更新 75%

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

SkillSafetyBench:在技能面攻击表面下评估智能体安全性

Chang Jin, An Wang, Zeming Wei, Kai Wang, Biaojie Zeng, Qiaosheng Zhang, Chao Yang, Jingjing Qu, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27881 2026-08-31 cs.CV 新提交 71%

StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models

StreamEMS:面向视觉语言模型的自演进记忆方案的流视频理解

Yuxin Liu, Peiqin Zhuang, Yali Wang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 长上下文与记忆 :language model(title)

AI总结 本研究提出StreamEMS机制,通过语义与先验感知两个演进模块优化记忆表征,在OVO-Bench等数据集上优于现有方法,高token下降率下仍具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28315 2026-08-31 cs.AI 新提交 70%

MAIL: Memory-driven, Adaptive, Incremental, and Literature-grounded Framework for Hypothesis Generation in Chemistry

MAIL:用于化学领域假说生成的记忆驱动、自适应、增量式且基于文献的框架

Mahdi Babaei, Xueshen Li, Yutao Kuang, Jolene P. Reid, Yu Gan

机构 * Stevens Institute of Technology(史蒂文斯理工学院) University of British Columbia(不列颠哥伦比亚大学) University of Maryland(马里兰大学) Artificial Intelligence Interdisciplinary Institute at Maryland(马里兰人工智能跨学科研究所)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出MAIL框架,将化学假说生成视为记忆驱动的时间推理过程,在TOMATO-Chem与HN-NS数据集上验证其能生成高质量新颖假说,展现了LLMs在化学领域自主探索的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27924 2026-08-31 cs.CL 新提交 70%

What Makes Agent Memory Useful for Reliable Unanswerable Question Handling?

是什么让智能体记忆对可靠的无答案问题处理有用?

Chuanyuan Tan, Junjie Yu, Yuxin Wang, Yining Zheng, Xipeng Qiu, Wenliang Chen

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Suzhou City University(苏州城市学院) Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学技术与人工智能学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究在agentic RAG框架下,评估不同记忆方法对UAQ处理的作用,发现记忆提升UAQ性能具选择性,程序与规则类记忆结合互补信号效果最优,可靠UAQ记忆依赖保留可迁移行为指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22149 2026-08-31 cs.RO cs.AI 版本更新 70%

Meta-Ctrl: Guaranteed Plan Generation by Decoupling Syntactic and Semantic Constraints

Meta-Ctrl:通过分离句法与语义约束实现带保证的规划生成

Gwen Yidou-Weng, Edward Sun, Tianyi Ma, Metin Alp Dogan, Benjie Wang, Allen Peng, Guy Van den Broeck, Yuchen Cui

机构 * Michigan State University(密歇根州立大学) University of California Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 Meta-Ctrl是一种约束解码框架,通过引入元标记分离句法与语义约束,在保证规划满足约束的同时保留语言模型的规划质量,在WAH-NL数据集和真实桌面机器人上均取得优于GPT-4的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27763 2026-08-31 cs.LG cs.CL stat.ML 新提交 62%

Fast Weight Attention for Continual Learning

用于持续学习的快速权重注意力

Yifan Zhang, Steve Ta, Jasper Zhang, Jichen Feng, Shuzhen Li, Yongxin Zhang, Yifeng Liu, Huizhuo Yuan, Mengdi Wang, Quanquan Gu, Andrew Chi-Chih Yao

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对持续学习,推导了Falcon系列快速权重更新规则,结合多种计算形式,在语言建模等任务中保持竞争力并提升可变数字加法的长度外推能力,分离了序列模型的时间对齐等关键机制。

Comments Project Page: this https URL (https://github.com/yifanzhang-pro/fast-weight-attention)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25553 2026-08-31 cs.IR cs.AI cs.CL 版本更新 62%

When Stale Constraints Go Unchecked: Budgeted Verification Failures in Inherited Agent Memory

当过时约束未被核查:智能体继承记忆中的带预算验证失败

Kazuki Nakayashiki

机构 * Glasp

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对智能体继承记忆中过时约束未被核查的问题,建模替代机制,发现重新分配预算槽位给关键路径可显著提升当前记录一致的决策,为记忆系统设计提供了参考。

Comments 41 pages, 3 figures, 18 tables. v3: adds four prospectively frozen, externally deposited experiments (interleaved replication with a repaired control; content-free freshness cue; ten-model cross-organisation panel; budget sweep and target-blind allocation rules); abstract, figures and limitations rewritten; the four original runs unchanged. Data and code at Zenodo: doi: https://doi.org/10.5281/zenodo.22147784

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 51 篇

2604.12379 2026-08-31 cs.SE cs.AI cs.LG 版本更新 92%

Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks

超越输出正确性:评估大型语言模型在编码任务中的推理能力

Yuangang Li, Justin Tian Jin Chen, Ethan Yu, David Hong, Iftekhar Ahmed

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CodeRQ-Bench,首个评估LLM在生成、摘要和分类等编码任务中推理质量的基准,通过分析现有评估器的1069个不匹配案例,提出VERA评估器,实验表明其在四个数据集上均优于基线,提升AUCROC和AUPRC最高达0.26和0.21。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27932 2026-08-31 cs.HC 新提交 91%

Graphionale: How Graph Visualizations of LLM Rationales Affect Human Decision Making

Graphionale:LLM推理依据的图形可视化如何影响人类决策

Xinru Wang, Zhexuan Ma, Ming Yin, Shuai Ma, Thomas W Malone

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究开发了Graphionale作为测试平台,通过204人在线用户研究发现,图形化LLM推理依据对不同任务模态的决策影响不同,匹配推理格式与任务模态是AI解释设计的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏