arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19063 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19063 篇

2605.23116 2026-05-25 cs.CV cs.AI 77%

CoReVAD: A Contextual Reasoning Framework for Training-Free Video Anomaly Detection

CoReVAD: 一种无需训练的视频异常检测上下文推理框架

Hyeongmuk Lim, Youngbum Hur

机构 * Department of Industrial Engineering, Inha University, Incheon, Republic of Korea(韩国釜山大学工业工程系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 提出CoReVAD框架,利用单一冻结视觉语言模型直接生成异常分数和时间描述,通过局部响应清洗和全局时序上下文精炼实现无需训练的视频异常检测,在UCF-Crime和XD-Violence数据集上取得竞争性能并提供可解释解释。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12787 2026-05-25 cs.AI cs.MA 77%

Ax-Prover: A Deep Reasoning Agentic Framework for Theorem Proving in Mathematics and Quantum Physics

Ax-Prover:用于数学和量子物理定理证明的深度推理智能体框架

Benjamin Breen, Marco Del Tredici, Jacob McCarran, Javier Aspuru Mijares, Weichen Winston Yin, Kfir Sulimany, Jacob M. Taylor, Frank H. L. Koppens, Dirk Englund

机构 * Axiomatic_AI(公理人工智能) Massachusetts Institute of Technology (MIT)(麻省理工学院) Institut de Ciències Fotòniques (ICFO)(光子科学研究所) Institució Catalana de Recerca i Estudis Avançats (ICREA)(加泰罗尼亚高级研究与高等学院)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出多智能体系统Ax-Prover,通过将大语言模型与Lean工具结合,实现跨科学领域的自动化定理证明,并在抽象代数和量子理论新基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19943 2026-05-20 cs.AI 77%

Probabilistic Tiny Recursive Model

概率性微型递归模型

Amin Sghaier, Ali Parviz, Alexia Jolicoeur-Martineau

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出概率性微型递归模型(PTRM),通过在递归步骤中注入高斯噪声,使模型能够并行探索多样化的解决方案盆地,从而在不重新训练或进行任务特定增强的情况下,提升多个基准测试的准确性,包括Sudoku-Extreme和Pencil Puzzle Bench上的各种谜题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04727 2026-05-19 cs.CV cs.AI 77%

Are Multimodal LLMs Ready for Surveillance? A Reality Check on Zero-Shot Anomaly Detection in the Wild

多模态大语言模型是否准备好用于监控?对零样本异常检测在现实中的检验

Shanle Yao, Armin Danesh Pazho, Narges Rashvand, Hamed Tabkhi

机构 * Electrical and Computer Engineering Department(电气与计算机工程系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型在现实中的零样本异常检测性能,发现其存在保守偏差,通过特定指令可以提升F1分数,但召回率仍是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08679 2026-05-19 cs.AI 77%

PersonaDual: Balancing Personalization and Objectivity via Adaptive Reasoning

PersonaDual: 通过自适应推理平衡个性化与客观性

Xiaoyou Liu, Xinyi Mou, Shengbin Yue, Liang Wang, Yuqing Wang, Qiexiang Wang, Tianrui Qin, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) OPPO

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);LLM(abstract_cn);分类 cs.AI

AI总结 本文提出PersonaDual框架,通过自适应切换模式,在单一模型中实现通用客观推理与个性化推理的平衡,减少干扰并提升客观问题解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12766 2026-05-19 cs.CL 77%

NaviRAG: Towards Active Knowledge Navigation for Retrieval-Augmented Generation

NaviRAG:迈向检索增强生成的主动知识导航

Jihao Dai, Dingjun Wu, Yuxuan Chen, Zheni Zeng, Yukun Yan, Zhenghao Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Nanjing University(南京大学) Northeastern University(东北大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 NaviRAG通过主动知识导航框架提升检索增强生成的复杂任务处理能力,通过分层知识组织和动态信息检索提高检索准确率和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15237 2026-05-18 cs.AR cs.AI 77%

A3D: Agentic AI flow for autonomous Accelerator Design

A3D: 基于代理AI的自主加速器设计流程

Abinand Nallathambi, Christopher Knight, Shantanu Ganguly, Wilfried Haensch, Anand Raghunathan

机构 * Purdue University(普渡大学) Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 A3D通过代理AI实现端到端的硬件加速器设计自动化,自动分析工作负载、识别性能瓶颈、生成微架构并探索速度-面积权衡空间,利用LLM和EDA工具提升复杂应用的加速器设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14857 2026-05-15 cs.AI cs.IR 77%

A Deterministic Agentic Workflow for HS Tariff Classification: Multi-Dimensional Rule Reasoning with Interpretable Decisions

一种确定性代理工作流用于HS税则分类:多维规则推理与可解释决策

Yu Zhang, Dongjiang Zhuang, Qu Zhou, Zheng Huang, Junhe Wu, Jing Cao, Kai Chen

机构 * School of Information and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, China(信息与电子工程学院,上海交通大学,上海,中国) Nanjing Jiyun Information Technology Co., Ltd., Nanjing, China(南京吉云信息技术有限公司,南京,中国) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(计算机科学学院,上海交通大学,上海,中国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出确定性代理工作流,通过多维规则推理实现HS税则分类,通过结构化输出和引用注释提升可解释性,实验显示在六位和四位税则层面均取得较高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14465 2026-05-15 cs.AI 77%

From Table to Cell: Attention for Better Reasoning with TABALIGN

从表格到单元格:用于基于TABALIGN的更好推理的注意力

Tung Sum Thomas Kwok, Zeyong Zhang, Xinyu Wang, Chunhe Wang, Xiaofeng Lin, Hanwei Wu, Lei Ding, Guang Cheng, Zhijiang Guo

机构 * University of California, Los Angeles(加州大学洛杉矶分校) New Jersey Institute of Technology(新泽西理工学院) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) University of Manitoba(曼尼托巴大学) SimpleWay The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文提出TABALIGN框架,通过引入DLM Planner和TABATTN验证器,提升表格推理的准确性和效率,实验显示在多个基准测试中准确率提升15.76个百分点,推理速度加快44.64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12953 2026-05-14 cs.CV cs.AI 77%

Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation

Seg-Agent: 无训练语言引导分割的测试时多模态推理

Chao Hao, Jun Xu, Ji Du, Shuo Ye, Ziyue Qiao, Xiaodong Cun, Guangcong Wang, Xubin Zheng, Zitong Yu

机构 * School of Computing and Information Technology(计算与信息科技学院) Great Bay University(大湾大学) Hangzhou International Innovation Institute(杭州国际创新研究院) Beihang University(北航大学) Department of Computing(计算系) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 Seg-Agent提出无训练的多模态推理框架,通过生成-选择-细化三阶段循环实现视觉区域分割,无需参数更新即可达到与训练方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08992 2026-05-14 cs.LG 77%

Constraints-of-Thought: A Framework for Constrained Reasoning in Language-Model-Guided Search

思维约束:一种在语言模型引导搜索中进行约束推理的框架

Kamel Alrashedy, Vriksha Srihari, Zulfiqar Zaidi, Ridam Srivastava, Pradyumna Tambwekar, Matthew Gombolay

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Const-o-T框架,通过约束推理提升语言模型在多步骤任务中的规划效率和决策可靠性,适用于风险游戏、CAD代码生成和算术推理等复杂领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13841 2026-05-13 cs.CL 77%

The Challenge and Reward of Fair Play in Narrative: A Computational Approach

叙事中的公平游戏挑战与回报:一种计算方法

Eitan Wagner, Renana Keydar, Omri Abend

机构 * Department of Computer Science Hebrew University of Jerusalem(计算机科学系 Hebrew University of Jerusalem) Department of Law and Digital Humanities Hebrew University of Jerusalem(法律与数字人文系 Hebrew University of Jerusalem)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过信息论框架分析叙事中的意外与连贯性,提出公平游戏平衡机制,利用大语言模型验证理论,发现惊喜与连贯性不正相关,且文学作品中克里斯蒂的叙事更符合公平游戏标准。

Comments 47 pages, 11 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11439 2026-05-13 cs.CV cs.LG 77%

Instruct-ICL: Instruction-Guided In-Context Learning for Post-Disaster Damage Assessment

Instruct-ICL:基于指令的上下文学习用于灾后损害评估

Armin Zarbaft, Ehsan Karimi, Nhut Le, Maryam Rahnemoonfar

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.LG

AI总结 本文提出Instruct-ICL方法,通过指令引导的上下文学习提升预训练多模态大语言模型在灾后视觉问答中的可靠性,实验表明结合CoT推理能显著提高回答准确性。

Comments Accepted by the 2026 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07782 2026-05-13 cs.CL cs.PL 77%

CktFormalizer: Autoformalization of Natural Language into Circuit Representations

CktFormalizer: 自然语言到电路表示的自动形式化

Jing Xiong, Qi Han, Chenchen Ding, He Xiao, Zunhai Su, Chaofan Tao, Ngai Wong

机构 * The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 CktFormalizer通过依赖类型HDL在Lean 4中实现LLM生成硬件描述的自动形式化,解决Verilog中的宽度不匹配、组合环和不完整案例逻辑问题,提升后端实现率和仿真通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10960 2026-05-12 cs.LG math.ST stat.TH 77%

Ranking Reasoning LLMs under Test-Time Scaling

在测试时间扩展下对推理LLM进行排名

Mohsen Hariri, Michael Hinczewski, Jing Ma, Vipin Chaudhary

机构 * Department of Computer and Data Sciences(计算机与数据科学系) Department of Physics(物理系) Case Western Reserve University(凯斯西储大学)

专题命中 推理与问题求解 :LLM(title_cn,abstract_cn);分类 cs.LG

AI总结 本文提出Scorio库,通过统计排名方法评估推理模型,在20个数学竞赛基准上验证了多种排名方法的有效性,并展示了在不同测试时间扩展下的性能。

Comments Code is available at https://github.com/mohsenhariri/scorio

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07660 2026-05-11 cs.CL 77%

Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning

并非所有令牌都以相同方式学习:注意力熵揭示了强化学习推理中的异质信号

Gengyang Li, Zheng-Fan Wu, Siqi Bao, Yunfang Wu

机构 * Baidu(百度) School of Computer Science, Peking University(北京大学计算机科学系) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究通过注意力熵揭示强化学习推理中令牌层面的异质性,发现高熵令牌(探索者)与低熵令牌(锚点)在学习信号上有显著差异,动态熵感知的软重加权干预提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05538 2026-05-08 cs.AI cs.IR 77%

AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases

AgenticRAG:企业知识库中的代理检索

Susheel Suresh, Hazel Mak, Shangpo Chou, Fred Kroon, Sahil Bhatnagar

机构 * Microsoft Corporation(微软公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 AgenticRAG通过在现有企业检索基础设施上叠加轻量级代理框架,使语言模型能够自主迭代检索信息、导航文档并分析证据,提升了检索准确率和事实性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01299 2026-05-05 cs.LG 77%

GA-VisAgent: A Multi-Agent application for code generation and visualization in interactive learning

GA-VisAgent:一种用于交互式学习中代码生成和可视化的多智能体应用

Wang Jian, Zhou Jianbo, Xiong Yuhao, Liu Zhenxia, Luo Wen, Yuan LinWang, Yu ZhaoYuan

机构 * School of Geography, Nanjing Normal University, Nanjing 210023, Jiangsu, China(地理学院,南京师范大学) School of Environment, Nanjing Normal University, Nanjing 210023, Jiangsu, China(环境学院,南京师范大学) Key Laboratory of Virtual Geographic Environment, Ministry of Education, Nanjing Normal University, Nanjing 210023, Jiangsu, China(虚拟地理环境重点实验室,南京师范大学) Jiangsu Center for Collaborative Innovation in Geographical Information Resource Development(江苏省地理信息资源开发与应用协同创新中心)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 GA-VisAgent基于GAGPT提出多智能体应用,通过任务规划和ReAct策略生成代码并提供可视化,实验显示在40个典型Conformal GA任务中代码生成成功率达90%,比GPT-4o提升70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12464 2026-05-05 cs.AI 77%

Reasoning Models Can be Accurately Pruned Via Chain-of-Thought Reconstruction

推理模型可通过思维链重建实现准确剪枝

Ryan Lucas, Kayhan Behdin, Zhipeng Wang, Qingquan Song, Shao Tang, Rahul Mazumder

机构 * LinkedIn, Sunnyvale, CA(LinkedIn,硅谷,加利福尼亚州) Massachusetts Institute of Technology, Cambridge, MA(麻省理工学院,剑桥,马萨诸塞州)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文提出通过重建思维链实现推理模型的高效剪枝,改进传统剪枝方法以适应推理任务,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19699 2026-04-29 cs.CL cs.CY 77%

Epistemic orientation in parliamentary discourse is associated with deliberative democracy

议会话语中的认知倾向与 deliberative democracy 的关联

Segun Aroyehun, Stephan Lewandowsky, David Garcia

机构 * Department of Politics and Public Administration, University of Konstanz(康斯坦茨大学政治与公共行政系) School of Psychological Science, University of Bristol(布里斯托大学心理学科学学院) Complexity Science Hub(复杂性科学中心) Department of Psychology, University of Potsdam(波茨坦大学心理学系)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过EMI评分分析议会话语中的认知倾向,发现其与democratic deliberation和治理质量正相关,揭示政治话语的认知特性对民主和治理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24536 2026-04-28 cs.CL 77%

Generating Place-Based Compromises Between Two Points of View

在两种观点之间生成基于地点的妥协

Sumanta Bhattacharyya, Francine Chen, Scott Carter, Yan-Ying Chen, Tatiana Lau, Nayeli Suseth Bravo, Monica P. Van, Kate Sieck, Charlene C. Wu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Toyota Research Institute(丰田研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 本文提出通过外部共情相似性生成基于地点的妥协方法,提升妥协的可接受性,并通过人偏好对齐训练更高效的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15390 2026-04-28 cs.SE cs.AI 77%

Analyzing Chain of Thought (CoT) Approaches in Control Flow Code Deobfuscation Tasks

分析控制流代码去混淆任务中的链式思维(CoT)方法

Seyedreza Mohseni, Sarvesh Baskar, Edward Raff, Manas Gaur

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文探讨了基于链式思维提示的代码去混淆方法,评估了五种先进大语言模型,发现CoT提示显著提高了去混淆质量,GPT5在控制流图重建和语义保留方面表现最佳,平均提升约16%和20.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18563 2026-04-28 cs.AI cs.MA econ.TH 77%

Reasonably reasoning AI agents can avoid game-theoretic failures in zero-shot, provably

合理推理的AI代理可以在零样本情况下避免博弈论失败并得到证明

Enoch Hyunwook Kang

机构 * Foster School of Business, University of Washington(华盛顿大学福斯特商学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本文研究了AI代理在重复博弈中的稳定性,证明了基于贝叶斯后验采样的代理能趋近纳什均衡,且在未知收益情况下仍保持收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20382 2026-04-23 cs.CL 77%

Graph2Counsel: Clinically Grounded Synthetic Counseling Dialogue Generation from Client Psychological Graphs

Graph2Counsel: 从客户端心理图谱生成临床导向的合成咨询对话

Aishik Mandal, Hiba Arnaout, Clarissa W. Ong, Juliet Bockhorst, Kate Sheehan, Rachael Moldow, Tanmoy Chakraborty, Iryna Gurevych

机构 * UKP Lab, Department of Computer Science and Hessian Center for AI (hessian.AI), Technische Universität Darmstadt(德国达姆施塔特技术大学UKP实验室、计算机科学系和海森人工智能中心(hessian.AI)) Zuse School ELIZA(Zuse学院ELIZA) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE) Indian Institute of Technology Delhi(印度德里理工学院) Yardi School of Artificial Intelligence(Yardi人工智能学院) University of Louisville(路易斯维尔大学) University of Toledo(托莱多大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出Graph2Counsel框架,通过客户端心理图谱生成合成咨询对话,提升数据真实性与质量,实验表明其在特定性、咨询师能力等方面优于现有数据集。

Comments 49 pages, 46 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17225 2026-04-21 cs.CL 77%

A Multi-Agent Approach for Claim Verification from Tabular Data Documents

从表格数据文档中验证声明的多智能体方法

Rudra Ranajee Saha, Laks V. S. Lakshmanan, Raymond T. Ng

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 本文提出多智能体框架MACE,通过规划器、执行器和验证器三个智能体,实现可解释的表格数据验证,实验显示其在多个数据集上达到SOTA性能,且在参数较少时仍表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14930 2026-04-17 cs.CL 77%

IE as Cache: Information Extraction Enhanced Agentic Reasoning

信息提取作为缓存:增强代理推理

Hang Lv, Sheng Liang, Hongchao Gu, Wei Guo, Defu Lian, Yong Liu, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本文提出IE-as-Cache框架,将信息提取用作认知缓存以提升代理推理能力,通过查询驱动提取与缓存感知推理动态维护紧凑中间信息并过滤噪声,实验表明在多种LLM上显著提升推理准确性。

Comments 8pages, 2figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14853 2026-04-17 cs.LG 77%

Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization

通过约束策略优化实现推理大语言模型的自适应推理时间计算分配

Zhiyuan Zhai, Bingcong Li, Bingnan Xiao, Ming Li, Xin Wang

机构 * Fudan University(复旦大学) ETH Zurich(苏黎世联邦理工学院) Guangming Lab(光明实验室)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过约束优化问题解决推理时间计算分配问题,采用两阶段解决-学习流程,在解决阶段利用拉格朗日松弛分解全局约束,学习阶段训练轻量分类器预测 oracle 动作,实验证明方法在 MATH 和 GSM8K 数据集上优于均匀和启发式分配基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03851 2026-04-17 cs.AI 77%

MetaMuse: Algorithm Generation via Creative Ideation

MetaMuse:通过创造性构思生成算法

Ruiying Ma, Chieh-Jan Mike Liang, Yanjie Gao, Francis Y. Yan

机构 * University of California, Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文研究LLM在算法生成中的应用,提出MetaMuse框架,通过三个自反思原则提升创造性构思,实验显示其在缓存替换和在线装箱问题中性能提升显著。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12748 2026-04-15 cs.CL 77%

Generating Effective CoT Traces for Mitigating Causal Hallucination

生成有效的CoT轨迹以缓解因果幻觉

Yiheng Zhao, Jun Yan

机构 * Concordia University(康科迪亚大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了生成有效CoT轨迹以缓解小模型因果幻觉的问题,设计了生成管道并提出新的量化指标CHR,实验表明生成的CoT轨迹能有效减少幻觉并提升准确性。

Comments 11 pages, 2 figures. Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12282 2026-04-15 cs.CL 77%

Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format Reasoning

面向多代理多格式推理的鲁棒现实世界电子表格理解

Houxing Ren, Mingjie Zhan, Zimu Lu, Ke Wang, Yunqiao Yang, Haotian Hou, Hongsheng Li

机构 * CUHK MMLab(CUHK多模态实验室) SenseTime Research(商汤科技研究院) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SpreadsheetAgent框架,通过多模态逐步阅读推理解决大规模电子表格处理问题,通过结构草图和行列摘要提升推理可靠性,实验表明其在Spreadsheet Bench上表现优异。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏