arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-27 至 2026-08-27 共收录 401 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 19 篇

2608.26008 2026-08-27 cs.CR cs.CL 新提交 92%

A Self-Evolving Multi-Agent Framework Defense against LLM Jailbreak Attacks

一种针对LLM越狱攻击的自进化多智能体框架防御方法

Tongyan Hu, Bryan Hooi

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究针对LLM越狱攻击提出一种基于规则记忆的自进化多智能体防御框架,无需参数更新,可降低攻击成功率且保留良性效用,适用于两类LLM模型。

Comments 8 pages (main), with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25570 2026-08-27 cs.LG cs.MA 新提交 89%

Beyond Scaling: Self-Evolving LLM Agents for Hardware Kernel Optimization via an Experience-Driven Workflow and Experience Graph Memory

超越缩放:基于经验驱动工作流与经验图记忆的硬件内核优化自演进大语言模型智能体

Siyuan Chen, Runlin Hou, Shenxiu Wu, Yansong Sun, Junming Cao, Yiyu Zhang, Shudi Shao, Junhao Qiu, Zhichao Lu, Qingfu Zhang

机构 * City University of Hong Kong(香港城市大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 长上下文与记忆 :LLM(title,summary_cn);foundation model(abstract);分类 cs.LG

AI总结 本文提出KOPE框架,通过经验图记忆与主动上下文管理实现硬件内核优化自演进LLM智能体,在相同模型设置下其加速比、通过率等关键指标显著优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24913 2026-08-27 cs.HC cs.SE 新提交 87%

From Blind Edits to Verified Repair: Building Trustworthy User-Side LLM Agents for Web Accessibility

从盲编辑到经验证的修复:构建可信的用户端大语言模型智能体以实现网页可访问性

Lily Bundgaard Wanscher, Markus Heidemann Lorensen, Mohammed Ammad Shafiq, Mahyar Tourchi Moghaddam, Mina Alipour

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究构建了用户端LLM智能体的三个核心模块,通过双条件协议诊断盲编辑的缺陷,再结合验证修复工具实现了网页可访问性的可信修复,相关资源已公开。

Comments Accepted to be presented at ICME 2026 (5-9 October, Napoli, Italy) and to be published in ICMI companion proceedings by ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26005 2026-08-27 eess.AS cs.AI cs.IR cs.MM cs.SD 新提交 84%

VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction

VoiceMem:用于实时交互的双脑流式记忆系统

Zhifei Xie, Jiaqi Lang, Ze An, Yifan Zhao, Dongchao Yang, Kai Li, Ziyang Ma, Mingbao Lin, Chunyan Miao, Shuicheng Yan

专题命中 长上下文与记忆 :SLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出VoiceMem双脑流式记忆架构,构建完整流水线实现记忆感知SLM的训练、评估与部署,其在准确性、情感个性化及实时性上优势显著,为实时语音交互提供实用记忆基础。

Comments 18 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25061 2026-08-27 cs.CL cs.AI cs.DB cs.LG cs.PL 新提交 83%

DataKernelBench: Can LLMs Optimize Database Queries on GPUs?

DataKernelBench:大语言模型能否在GPU上优化数据库查询?

Gokul Karthik Kumar, Yotam Perlitz, Corey Lammie, Andrea Giovannini, Katja Hose

机构 * IBM Research(IBM研究院) TU Wien(维也纳技术大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DataKernelBench基准,评估LLM在GPU上优化数据库查询内核的能力,实验显示最强模型配置在TPC-H数据集上实现2.11倍加速,工作负载上下文对性能影响大于硬件上下文。

Comments Accepted at EMNLP 2026. Homepage: this https URL (https://kerneldf.github.io/datakernelbench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25655 2026-08-27 cs.CL cs.AI 新提交 82%

Reconstructing the Right Episode: Evaluating Interleaved Conversational Memory Beyond Long Context

重构正确的会话片段:超越长上下文的交错式对话记忆评估

Zhexi Feng, Ruiyi Zhang, Yongbo Yang, Pengtao Xie

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对混合主题长对话的记忆难题,研究人员构建了SCALE-QA基准,并提出TSIM方法,在三类LLM后端上均比最强基线提升5.6-17.6个准确率点,实现最优表现。

Comments 19 pages, 6 figures, 30 tables. Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25577 2026-08-27 cs.DB cs.AI 新提交 81%

PolyMemDB: A Polyglot Database System for AI Memory Management

PolyMemDB:一款面向AI记忆管理的多语言数据库系统

Yu Wang, Jiaheng Lu

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对现有智能体记忆系统的存储碎片化与事实冲突问题,推出PolyMemDB多语言数据库系统,通过多语言存储架构与概率推理引擎管理智能体记忆,以减少LLM幻觉并提升个性化体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25729 2026-08-27 cs.CV 新提交 80%

LongVU-TTT: Causal Test-Time Training for Visual Resampling in Long Video Understanding

LongVU-TTT:用于长视频理解中视觉重采样的因果测试时训练方法

Mahmoud Ahmed, Sameh Abdulah, Olatunji Ruwase, Sam Ade Jacobs, Mathis Bode, Mohamed Elhoseiny

机构 * KAUST(阿卜杜拉国王科技大学) Snowflake(雪花公司) Microsoft Inc.(微软公司) Jülich Supercomputing Centre, Forschungszentrum Jülich(于利希研究中心于利希超级计算中心)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 LongVU-TTT在视觉编码器与LLM间插入带因果快速权重更新的卷积TTT重采样器,通过混合选择器保留帧证据,在五个视频理解基准测试中性能具竞争力,较多种基线方法有明显提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03297 2026-08-27 cs.CL cs.AI cs.LG 版本更新 75%

TTSR: Test-Time Self-Evolving via Reflection

TTSR: 测试时自我反思以提升持续推理能力

Haoyang He, Zihua Rong, Yunjia Zhao, Lan Yang, Jian Chang, Honggang Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Southwestern University of Finance and Economics(西南财经大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TTSR通过测试时自我反思机制,利用学生与教师角色交替,持续改进大语言模型的推理能力。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21725 2026-08-27 cs.CL cs.AI cs.CE 版本更新 73%

AEL: Evolving Agent Harness in Open-Ended Environments

AEL:开放环境中演化的智能体 harness

Wujiang Xu, Jiaojiao Han, Minghao Guo, Kai Mei, Xi Zhu, Han Zhang, Dimitris N. Metaxas

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出双时间尺度框架AEL,将记忆使用转化为在线策略选择,在顺序投资组合和支持工单路由任务中均显著优于多种基线方法,性能提升具有因果性。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25593 2026-08-27 cs.CL cs.LG 新提交 73%

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

JIT-Agent:通过即时测试框架演进扩展测试框架智能

Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie, Zhaochen Yu, Zihang Liu, Zhongxiang Sun, Qiankun Li, Yue Liao, Heng Chang, Xiaobin Hu, Qibing Ren, Wangchunshu Zhou, Shuicheng Yan

机构 * LV-NUS Lab(LV-NUS实验室)

专题命中 长上下文与记忆 :LLM(abstract_cn);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 JIT-Agent是首个专为即时生成智能体测试框架设计的模型,可定制、修复、自我演进测试框架,提升DeepSeek、GLM等模型在多基准任务的性能,确立测试框架智能为智能体能力的独立可扩展维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11544 2026-08-27 cs.CL cs.AI 版本更新 73%

Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory

时间并非标签:连续相位旋转用于时间知识图谱与智能记忆

Weixian Waylon Li, Jiaxin Zhang, Xianan Jim Yang, Tiejun Ma, Yiwen Guo

机构 * University of Edinburgh(爱丁堡大学) LIGHTSPEED University of St Andrews(圣安德鲁斯大学) Independent Researcher(独立研究员)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出RoMem模块,通过连续相位旋转技术解决时间信息在知识图谱中的表示问题,提升时间推理和记忆保持性能,实现状态-of-the-art结果。

Comments EMNLP 2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10679 2026-08-27 cs.CV 版本更新 71%

Synergistic Modality-and-Slice Memory Framework for Cross-Modal 3D Brain Tumor Segmentation

用于跨模态3D脑肿瘤分割的协同模态与切片记忆框架

Yuxiang Luo, Qing Xu, Hai Huang, Yuqi Ouyang, Xiangjian He, Zhen Chen, Wenting Duan, Jiebo Luo

机构 * Graduate School of Information, Production and Systems, Waseda University, Japan(信息、生产与系统研究生院,早稻田大学,日本) School of Computer Science, University of Lincoln, UK(林肯大学计算机科学学院,英国) University of Nottingham, UK(诺丁汉大学,英国) University of Nottingham Ningbo China, China(宁波诺丁汉大学,中国) College of Electrical Engineering and Information, Northeast Agricultural University, Harbin, China(电气工程与信息学院,东北农业大学,中国) College of Computer Science, Sichuan University, Chengdu, China(计算机科学学院,四川大学,中国) Yale University, New Haven, CT 06510, USA(耶鲁大学,美国) School of Engineering and Physical Science, University of Lincoln, Lincoln LN6 7TS, UK(工程与物理科学学院,林肯大学,英国)

专题命中 长上下文与记忆 :prompting(title)

AI总结 针对现有跨模态3D脑肿瘤分割方法忽略跨模态相关性、依赖特定类别提示的问题,提出MSM-Seg框架,通过MSMA、MCP-Encoder和MF-Decoder实现精准分割,性能优于现有方法。

Comments Accepted by TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22149 2026-08-27 cs.RO cs.AI 版本更新 70%

Meta-Ctrl: Guaranteed Plan Generation by Decoupling Syntactic and Semantic Constraints

Meta-Ctrl:通过分离句法与语义约束实现带保证的规划生成

Gwen Yidou-Weng, Edward Sun, Tianyi Ma, Metin Alp Dogan, Benjie Wang, Allen Peng, Guy Van den Broeck, Yuchen Cui

机构 * Michigan State University(密歇根州立大学) University of California Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 Meta-Ctrl是一种约束解码框架,通过引入元标记分离句法与语义约束,在保证规划满足约束的同时保留语言模型的规划质量,在WAH-NL数据集和真实桌面机器人上均取得优于GPT-4的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13024 2026-08-27 cs.CE 版本更新 67%

TIEM: Temporal Integration of Hypergraph Evidence and Skill Memory for Event-Driven Financial Forecasting

TIEM:用于事件驱动金融预测的超图证据与技能记忆的时间整合框架

Wenjin Liu, Shen Pang, Chenxi Wang, Tiesunlong Shen, Zhe Cui, Xiaobao Wu, Anh Tuan Luu, Haoran Luo

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 该研究针对事件驱动金融预测中大型语言模型智能体存在的证据鸿沟问题,提出带时间戳门控的TIEM框架,引入FinPURE基准,经多组金融基准验证其性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25411 2026-08-27 cs.CR cs.SC 版本更新 67%

Heimdall: Formally Verified Automated Migration of Legacy eBPF Programs to Rust

Heimdall: 形式化验证的遗留 eBPF 程序到 Rust 的自动迁移

Vishnu Asutosh Dasu, Monika Santra, Md Rafi Ur Rashid, Ashish Kumar, Saeid Tizpaz-Niari, Gang Tan

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出 Heimdall,一个利用大语言模型将遗留 libbpf C 程序自动翻译为 Aya Rust 的管道,通过静态分析和符号执行确保迁移后程序行为等价,并修复了 eBPF 程序中六类源级漏洞,包括未报告的信息泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22338 2026-08-27 cs.RO cs.AI cs.LG 版本更新 62%

RoboMME-Interference: Benchmarking Robot Memory Under Interference

干扰下的机器人记忆基准测试

Soumil Rathi

机构 * Independent Researcher(独立研究员)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出RoboMME-Interference基准,通过跨会话干扰评估机器人长期记忆能力,发现现有系统在干扰下性能显著下降。

Comments 9 pages, 5 figures. Updated results; added subgoal-memory systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12476 2026-08-27 cs.AI 版本更新 57%

Governed Persistent Memory: Source-Bound State Semantics and Fail-Closed Release for Long-Horizon Agents

受控持久内存:长程智能体的源绑定状态语义与故障关闭式释放

Guodong Xu

机构 * Qingdao Guodongxiansheng Network Technology Co., Ltd.(青岛果动先生网络科技有限公司)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文针对长程智能体内存的矛盾记录问题,提出受控持久内存(GPM)模型,经多组基准测试与服务评估,其在GPM-ReleaseBench、中英文指令分支等场景均实现零不匹配,修复大量基线故障且无退化。

Comments 23 pages, 2 figures, 11 tables. Includes a sealed end-to-end governed-memory service evaluation with an ungoverned local Qwen2.5-7B comparison

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01287 2026-08-27 cs.CV cs.AI 版本更新 57%

Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning

超越视觉记忆:潜在视觉推理的机制诊断

Jiawei Guo, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Shuai Dong, Feifei Zhai, Yu Zhou

机构 * Amap, Alibaba Group(阿里集团亚马通) Shanghai Innovation Institute(上海创新研究院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 通过分解潜在令牌为三个可测试组件,发现边界标记和格式而非潜在槽贡献了主要性能提升,揭示了潜在视觉推理的真正机制。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 53 篇

2608.25220 2026-08-27 cs.AI cs.LO math.OC 新提交 92%

FLARE: Verifying MILP Reformulations with LLM-Based Theorem Proving

FLARE:基于大语言模型定理证明的MILP重构验证方法

Henry Robbins, Connor Lawless, Madeleine Udell, Ellen Vitercik

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出FLARE方法,结合LLM智能体与Lean证明助手验证MILP重构,在FormulationBench的NP-难子集达100%准确率,还提出无需证书的FLARE-NL,为自动化优化建模提供可靠验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26036 2026-08-27 cs.AI cs.CL 新提交 90%

Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems

LLM数据智能体的追踪完整性:现实世界系统中可审计结构化推理的愿景

Srimonti Dutta, Akshata Kishore Moharir

机构 * WAI USA Research Labs(WAI美国研究实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文针对LLM数据智能体提出追踪完整性标准,结合执行契约实现,通过CAIT率实验表明需同时评估答案准确率与可审计计算,为现实系统的LLM数据智能体提供评估方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25992 2026-08-27 cs.AI cs.MA 新提交 90%

ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffs

ProgRouter:面向质量-成本权衡的多智能体大语言模型工作流的在线进度引导编排

Somgyuan Li, Ahmed M. Abdelmoniem, Shiqiang Wang

机构 * Aston University(阿斯顿大学) Queen Mary University of London(伦敦玛丽女王大学) University of Exeter(埃克塞特大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ProgRouter是一种在线进度引导路由框架,通过多视图任务进度评分器等机制,在多智能体LLM工作流中平衡任务质量与时间、成本预算,在多类任务数据集上较基线降低运营成本且保持性能。

Comments Accepted in Findings of the Association for Computational Linguistics: EMNLP 2026. Index Terms: Collaborative agentic workflows, LLM agent orchestration, Quality-cost trade-off, Task progress prediction, Online decision-making

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25039 2026-08-27 cs.AI 新提交 90%

LifePlanner: Evaluating LLM Agents for Geo-spatial Planning with Social Media Data

LifePlanner:利用社交媒体数据评估LLM智能体的地理空间规划能力

Zhen Dong, Yuning Peng, Yutao Shi, Lei Zhong, Yongsen Mao, Yuan Liu, Haiping Wang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究推出LifePlanner基准测试,结合社交媒体数据评估LLM智能体的地理空间规划能力,发现前沿LLM在简单检索中表现好但复杂规划通过率仅40.2%,失败源于证据获取、工具使用及约束整合问题,需改进实际规划能力而非单纯扩大模型规模。

Comments 25 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24889 2026-08-27 cs.AI 新提交 90%

Reliable LLM-Powered Decision Engines for Large-Scale Supply Chain Operations: Architecture, Safety, and Performance Guarantees

面向大规模供应链运营的可靠大语言模型驱动决策引擎:架构、安全性与性能保证

Nirmal Kumar Jingar

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大规模供应链的不确定性等挑战,提出结合LLM与优化等的LLM-DE架构,实现更智能、安全、可扩展的供应链决策,为下一代智能供应链提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24001 2026-08-27 cs.AI 版本更新 90%

Diverse by Reasoning: Harnessing the Wisdom of LLM Crowds for Future Prediction

通过推理实现多样性:利用大语言模型群体的智慧进行未来预测

Nirupam Chetlapalli, Yiming Liao, Min-Chun Chen, Keke Chen

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出感知行为框架构建多样化LLM群体,用K-means++聚类选代表,三模型群体预测性能优于全部25模型的投票,降本提效,凸显群体构成与代表性多样性的重要性。

Comments 13 pages, 4 figures, 5 tables. Submitted to IEEE BigData 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25379 2026-08-27 cs.CL cs.AI 新提交 89%

Adaptive Triggering for Bias Correction in LLM Reasoning

大语言模型推理中用于偏差校正的自适应触发机制

Nayoung Kim, Mickey Mancenido, Huan Liu

专题命中 推理与问题求解 :LLM(title,summary_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM推理中思维链提示引发的偏差问题,提出基于在线变点检测的自适应触发校正框架,在gpt-4o-mini等模型上验证了其在减少干预次数的同时保留准确率的优势。

Comments 10 pages, 6 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25771 2026-08-27 cs.HC cs.LG 新提交 89%

Large Language Model Few-Shot Prompting with Dilemma Training Outperforms Human Surrogates in Predicting Patient Preferences

采用困境训练的大语言模型少样本提示在预测患者偏好方面优于人类替代者

Natasha Ureyang, Sebastian Porsdam Mann, Yuxin Liu, Zuriel Hassirim, Melanie Almonte, Wenhao Chen, Joyce Ng, Thant Nay Lin, Aung Thiha, Gerald CH Koh, Brian David Earp, Pin Sym Foong

专题命中 推理与问题求解 :large language model(title);language model(title);prompting(title);分类 cs.LG

AI总结 该研究提出采用困境训练的P4-DT智能体,通过12组患者-替代者配对实验,其预测患者治疗选择的准确率达81.7%,优于人类替代者及相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25660 2026-08-27 cs.CL cs.AI 新提交 88%

Think-Probe-Respond: Improving Large Language Models as Judges of Research Idea Novelty

Think-Probe-Respond:提升大型语言模型作为研究创意新颖性评判者的能力

Tim Schopf, Tobias Schreieder, Akiko Aizawa

机构 * National Institute of Informatics(情报研究综合研究所) TU Dresden(德累斯顿工业大学) ScaDS.AI Dresden/Leipzig(德累斯顿/莱比锡应用数据科学中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型评判研究创意新颖性时的“中等新颖”偏差,提出TPR轻量方法,通过探测推理阶段隐藏状态的潜在评判约束最终响应,使性能提升22.30%。

Comments Accepted to EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03542 2026-08-27 cs.CL cs.AI 版本更新 88%

Layer-Order Inversion: Rethinking Latent Multi-Hop Reasoning in Large Language Models

层序倒置:重新思考大语言模型中的潜在多跳推理

Xukai Liu, Ye Liu, Jipeng Zhang, Yanghai Zhang, Kai Zhang, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出"层序倒置"现象,通过概率性回忆与提取框架解释大语言模型中多跳推理的机制,揭示了层序倒置与总跳步数的关系,并提供了多跳失败的诊断方法。

Comments 16 pages, 18 figures, EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25277 2026-08-27 cs.CL cs.AI 新提交 88%

Routed Graph Handoff: Adaptive Format Selection for Multi-Agent LLM Delegation

路由图交接:多智能体大语言模型委派的自适应格式选择

Pratyay Banerjee, Ankit Chadha

机构 * Amazon(亚马逊)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本研究针对多智能体 LLM 协调的高 token 开销问题,提出路由图交接方法,通过轻量级 LLM 路由器在图与自然语言间自适应选择,在多基准测试中实现性能提升或持平,且开销极低。

Comments Accepted in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏