arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18998 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18998 篇

2605.14386 2026-05-15 cs.NE cs.AI 81%

Darwin Family: MRI-Trust-Weighted Evolutionary Merging for Training-Free Scaling of Language-Model Reasoning

达尔文家族:基于MRI-信任权重的进化合并框架,用于无训练扩展语言模型推理

Taebong Kim, Youngsik Hong, Minsik Kim, Sunyoung Choi, Jaewon Jang, Junghoon Shin, Minseo Kim

机构 * VIDRAFT Inc.(VIDRAFT公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);post-training(abstract)

AI总结 达尔文家族通过无梯度权重空间重组实现大语言模型的无训练进化合并,展示出在推理任务中无需额外训练即可提升性能的可行性。

Comments NeurIPS 2026 submission. 18 pages including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14237 2026-05-15 cs.AI 81%

Good to Go: The LOOP Skill Engine That Hits 99% Success and Slashes Token Usage by 99% via One-Shot Recording and Deterministic Replay

Good to Go:LOOP技能引擎:通过一次录制和确定性重放实现99%的成功率并减少99%的token使用

Xiaohua Wang, Kai Yu, XuXiao Liang, Liang Wang, Chao Han

机构 * Artificial Intelligence Research Center, Bengbu Medical University(蚌埠医科大学人工智能研究中心) CHARMMIRAEL Biotech Co., Ltd(CHARMMIRAEL生物科技有限公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LOOP技能引擎通过一次录制和确定性重放,实现99%的成功率和99%的token减少,解决重复周期性任务中大语言模型的不确定性与高成本问题。

Comments 8 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10195 2026-05-15 cs.LG 81%

Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration

突破奖励障碍:通过投机探索加速树状思维推理

Shuzhang Zhong, Haochen Huang, Shengxuan Qiu, Pengfei Zuo, Runsheng Wang, Meng Li

机构 * Institute for Artificial Intelligence, Peking University School of Integrated Circuits, Peking University(人工智能研究院,北京大学集成电路学院,北京大学) School of Integrated Circuits, Peking University(集成电路学院,北京大学) ByteDance Seed(字节跳动种子)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SPEX方法,通过投机路径选择、预算分配和自适应终止技术,提升树状思维推理效率,实现1.2至3倍的加速,并与token级投机解码协同提升性能。

Comments OSDI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05820 2026-05-15 cs.SE cs.AI 81%

From Ranking to Reasoning: Explainable Web API Recommendation via Semantic Reasoning

从排序到推理:通过语义推理实现可解释的Web API推荐

Zishuo Xu, Dezhong Yao, Yao Wan

机构 * School of Software Engineering(软件工程学院) School of Computer Science and Technology(计算机科学与技术学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出WAR-R1框架,结合语义推理与自适应推荐,通过轻量级大语言模型生成API推荐及自然语言解释,提升推荐准确性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27517 2026-05-15 cs.CR cs.AI 81%

A Security Analysis of the OpenClaw AI Agent Framework

对OpenClaw AI代理框架的安全性分析

Surada Suwansathit, Yuxuan Zhang, Guofei Gu

机构 * SUCCESS Lab(SUCCESS实验室) Texas A&M University(德克萨斯大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文分析了OpenClaw AI代理框架的安全性,揭示了其在架构层和信任违反类型上的漏洞,发现三个主要问题:远程代码执行路径、执行允许列表的闭世界假设失效以及技能分发面缺乏运行时策略控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01750 2026-05-14 cs.MA cs.AI 81%

Talk is Cheap, Communication is Hard: Dynamic Grounding Failures and Repair in Multi-Agent Negotiation

言者无罪,沟通艰难:多智能体谈判中的动态 grounding 故障与修复

Yiheng Yao, Chelsea Zou, Robert D. Hawkins

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究多智能体谈判中动态 grounding 的故障与修复,通过多轮谈判游戏揭示四类失败模式,发现协调瓶颈在于动态 grounding 而非个体推理或信息不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12620 2026-05-14 cs.AI 81%

Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents

再思一次,行动一次:验证引导的动作选择用于具身智能体

Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach

机构 * Technical University of Darmstadt(达姆斯塔特技术大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出验证引导的动作选择框架,通过显式验证步骤提升基于MLLM的具身智能体的鲁棒性,实验证明在复杂任务中性能提升达36%。

Comments CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12532 2026-05-14 q-fin.TR cs.AI stat.ME 81%

AgenticAITA: A Proof-Of-Concept About Deliberative Multi-Agent Reasoning for Autonomous Trading Systems

AgenticAITA: 关于自主交易系统中 deliberative 多智能体推理的证明概念

Ivan Letteri

机构 * Department of Information Engineering, Computer Science, and Mathematics, Center of Excellence for Research DEWS, University of L’Aquila(信息工程、计算机科学和数学系,DEWS研究中心,拉奎拉大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AGENTICAITA框架,通过多智能体协作推理替代传统信号执行模式,实现自主交易系统中无离线训练的决策流程,展示其在金融决策中的可行性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08978 2026-05-13 cs.AI 81%

Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

学习探索:通过探索意识策略优化实现代理推理的扩展

Xingyuan Hua, Sheng Yue, Ju Ren

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) School of Cyber Science and Technology, Sun Yat-sen University Shenzhen Campus, Shenzhen, China(中山大学深圳校区信息科学与技术学院) State Key Laboratory of Internet Architecture, Tsinghua University, Beijing, China(清华大学互联网体系结构国家重点实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出一种探索意识强化学习框架,使LLM代理在不确定性高时主动探索,通过细粒度奖励函数和探索意识分组机制提升任务完成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10698 2026-05-12 cs.MA cs.AI 81%

The Bystander Effect in Multi-Agent Reasoning: Quantifying Cognitive Loafing in Collaborative Interactions

多智能体推理中的旁观者效应:量化协作互动中的认知惰性

Dahlia Shehata, Ming Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示多智能体系统中社交压力引发的认知惰性现象,通过评估22500条轨迹发现模型在协作中逻辑主权崩溃,揭示了主权缺口与对齐幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10327 2026-05-12 quant-ph cs.AI cs.SC 81%

SCALAR: A Neurosymbolic Framework for Automated Conjecture and Reasoning in Quantum Circuit Analysis

SCALAR:用于量子电路分析中自动猜想和推理的神经符号框架

Sean Feeney, Pooja Rao, Andreas Klappenecker, Reuben Tate, Yuri Alexeev, Stefano Mensa, Elica Kyoseva, Stephan Eidenbenz

机构 * 1Department of Computer Science, Texas A\&M University, College Station, USA 2NVIDIA Corporation, Santa Clara, USA Artificial Intelligence Division (CAI-3), Los Alamos National Laboratory, Los Alamos, USA

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 SCALAR框架结合量子模拟、符号猜想生成和LLM解释,通过CUDA-Q平台分析量子电路,生成优化QAOA参数与图不变量的关系猜想,并识别图结构特征与优化景观属性的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15599 2026-05-12 cs.AI 81%

Autonomous Business System via Neuro-symbolic AI

通过神经符号AI实现自主业务系统

Cecil Pang, Hiroki Sayama

机构 * School of Systems Science and Industrial Engineering, Binghamton University, State University of New York(宾夕法尼亚州立大学布林顿分校系统科学与工业工程学院) AI Engineering, USA TODAY Co., Inc.(USA TODAY公司人工智能工程部) Binghamton Center of Complex Systems, Binghamton University, State University of New York(宾夕法尼亚州立大学布林顿复杂系统中心) Waseda Innovation Lab, Waseda University(早稻田大学创新实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出自主业务系统AUTOBUS,结合大语言模型、谓词逻辑编程和企业数据,构建神经符号架构以执行端到端业务任务,通过人机协作提升业务处理的确定性和适应性。

Comments IEEE SysCon 2026

Journal ref 2026 IEEE International Systems Conference (SysCon), Halifax, NS, Canada, 2026, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09314 2026-05-12 cs.AI 81%

How LLMs Are Persuaded: A Few Attention Heads, Rerouted

大语言模型如何被说服:几个被重定向的注意力头

Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang

机构 * Northeastern University(东北大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Skywork AI

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);language model(abstract);分类 cs.AI

AI总结 研究揭示大语言模型在被说服时,少量中间层注意力头决定答案,通过重定向注意力产生事实性错误,该机制在开源LLM和现实攻击场景中均有效。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06483 2026-05-12 cs.AI cs.RO cs.SY eess.SY 81%

ReasonSTL: Bridging Natural Language and Signal Temporal Logic via Tool-Augmented Process-Rewarded Learning

ReasonSTL:通过工具增强的过程奖励学习桥接自然语言与信号时间逻辑

Bowen Ye, Zhijian Li, Junyue Huang, Junkai Ma, Xiang Yin

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出ReasonSTL框架,通过工具增强和过程奖励学习,解决自然语言到信号时间逻辑(STL)的转换难题,提供透明、低成本且隐私保护的正式规范起草方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00371 2026-05-12 cs.CL cs.CY cs.SE 81%

Reasoning Trajectories for Socratic Debugging of Student Code: From Misconceptions to Contradictions and Updated Beliefs

为学生代码进行苏格拉底调试的推理轨迹:从误解到矛盾与更新信念

Erfan Al-Hossami, Razvan Bunescu

机构 * University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出推理轨迹生成任务,通过标注的调试问题数据集探讨生成推理轨迹和基于LLM的苏格拉底对话方法,实验显示LLM能生成91%正确的推理轨迹和98.7%有效的对话内容。

Comments 25 pages, 2 tables, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09079 2026-05-12 cs.AI 81%

CauSim: Scaling Causal Reasoning with Increasingly Complex Causal Simulators

CauSim:通过日益复杂的因果模拟器扩展因果推理

Nicolás Astorga, Anita Kriz, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge, Cambridge, UK(剑桥大学 DAMTP 实验室,剑桥,英国)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CauSim通过构建日益复杂的因果模拟器,将因果推理从稀缺标签问题转化为可扩展的监督学习问题,实现跨表示的泛化和因果推理能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08817 2026-05-12 cs.AI 81%

How You Begin is How You Reason: Driving Exploration in RLVR via Prefix-Tuned Priors

如何开始就是如何推理:通过前缀微调先验驱动RLVR探索

Yifan Xu, Junren Chen, Yifan Chen

机构 * Hong Kong Baptist University(香港 Baptist 大学) University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出IMAX框架,通过训练软前缀来重塑基础模型的推理轨迹先验,以解决RLVR中探索不足的问题,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08686 2026-05-12 cs.AI 81%

Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs

迭代批评与路由控制器用于异构大语言模型的多智能体系统

Wenzhi Fang, Liangqi Yuan, Guangchen Lan, Dong-Jun Han, Christopher G. Brinton

机构 * Purdue University(普渡大学) Yonsei University(延世大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种迭代批评与路由控制器,通过将多智能体协调视为序列决策问题,改进多智能体系统的协调效率,实验表明其在多个异构系统和七个推理基准中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08467 2026-05-12 cs.LG 81%

CUDAHercules: Benchmarking Hardware-Aware Expert-level CUDA Optimization for LLMs

CUDAHercules:用于LLM的硬件感知专家级CUDA优化基准测试

Shiyang Li, Zijian Zhang, Guangyan Sun, Yuebo Luo, Winson Chen, Yanzhi Wang, Mingyi Hong, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) Northeastern University(东北大学)

专题命中 推理与问题求解 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CUDAHercules基准测试评估生成CUDA代码与人类专家级优化的差距,揭示自动化CUDA编程在硬件感知和优化策略上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08061 2026-05-11 cs.AI 81%

Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning

基于评分标准的强化学习:用于通用推理的结构化评判奖励

Manish Bhattarai, Ismael Boureima, Nishath Rajiv Ranasinghe, Scott Pakin, Dan O'Malley

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出基于评分标准的强化学习框架,通过LLM评判器生成多标准奖励,提升模型在通用推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07461 2026-05-11 cs.CL 81%

Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

基于评分标准的思考:从外部评估者到内部推理指导

Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出Think-with-Rubrics方法,通过将评分标准整合到推理过程中,使评分标准成为LLM生成的内部指导,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16130 2026-05-11 cs.HC cs.AI 81%

Replicating Human Motivated Reasoning Studies with LLMs

用LLMs复制人类动机性推理研究

Neeley Pate, Adiba Mahbub Proma, Hangfeng He, James N. Druckman, Daniel C. Molden, Gourab Ghoshal, Ehsan Hoque

机构 * University of Rochester(罗切斯特大学) Northwestern University(西北大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究通过复制四项政治动机性推理研究,发现基础LLM行为与人类行为不一致,且不同模型在回避回答和整合论点方面有相似表现,表明基础LLM可能不模拟人类动机性推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06444 2026-05-08 cs.AI 81%

SCRuB: Social Concept Reasoning under Rubric-Based Evaluation

SCRuB:基于规则评估的社会概念推理

Jamelle Watson-Daniels, Himaghna Bhattacharjee, Skyler Wang, Brandon Handoko, Antonio Li, Anaelia Ovalle, Mahesh Pasupuleti, Candace Ross, Vidya Sarma, Arjun Subramonian, Karen Ullrich, Will van der Vaart, Yijing Xin, Maximilian Nickel

机构 * Meta McGill University(麦吉尔大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SCRuB框架,用于评估大语言模型在社会概念推理方面的能力,通过专家和模型响应对比,展示前沿模型在五个维度上优于人类专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06403 2026-05-08 cs.CL cs.IR 81%

GATHER: Convergence-Centric Hyper-Entity Retrieval for Zero-Shot Cell-Type Annotation

GATHER:面向零样本细胞类型注释的收敛性超实体检索

Zhonghui Zhang, Feng Jiang, Shaowei Qin, Jiahao Zhao, Min Yang

机构 * Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院) Software College, Northeastern University(东北大学软件学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 GATHER通过全局多源图遍历识别拓扑收敛点,以高信息超实体捕捉实体协同,无需LLM参与检索,提升零样本细胞类型注释效率。

Comments Accepted to SIGIR 2026. 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19715 2026-05-08 cs.AI 81%

Neuro-Symbolic Proof Generation for Scaling Systems Software Verification

神经符号证明生成用于系统软件验证的扩展

Baoding He, Zenan Li, Wei Sun, Yuan Yao, Taolue Chen, Xiaoxing Ma, Zhendong Su

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Computer Science, Nanjing University, China(南京大学计算机科学学院) Department of Computer Science, ETH Zurich, Switzerland(苏黎世联邦理工学院计算机科学系) School of Computing and Mathematical Sciences, Birkbeck, University of London, UK(伦敦大学伯克贝克学院计算与数学科学学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种神经符号证明生成框架,通过结合大语言模型和交互式定理证明工具,实现系统级验证的自动化证明搜索,有效提升软件验证的可扩展性。

Comments Published as a conference paper at OSDI'2026, and code is available at \url{https://github.com/SoaringE/seL4-proof-search}

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28043 2026-05-01 cs.AI 81%

Collaborative Agent Reasoning Engineering (CARE): A Three-Party Design Methodology for Systematically Engineering AI Agents with Subject Matter Experts, Developers, and Helper Agents

协同智能体推理工程(CARE):一种三方设计方法论,用于系统性地工程化AI智能体,涉及领域专家、开发者和辅助智能体

Rahul Ramachandran, Nidhi Jha, Muthukumaran Ramasubramanian

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CARE提出一种系统化方法论,通过可重用的artifacts和阶段化流程,结合领域专家、开发者和辅助智能体,提升AI智能体的开发效率和复杂查询性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27699 2026-05-01 cs.AI 81%

Bridging Values and Behavior: A Hierarchical Framework for Proactive Embodied Agents

连接价值与行为:一种面向主动具身代理的分层框架

Chunhui Zhang, Yuxuan Wang, Aoyang Qin, Yi-Long Lu, Kunlun Wu, Yizhou Wang, Wei Wang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Computer Science, Peking University(北京大学计算机学院) Tsinghua University(清华大学) Nat’l Eng. Research Center of Visual Technology, Peking University(北京大学视觉技术国家工程研究中心) Institute for AI, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出ValuePlanner框架,通过分层认知架构分离高阶价值调度与低阶行动执行,结合LLM生成符号子目标并用PDDL规划器转化为行动计划,通过反馈机制提升自主性,实验表明其能生成连贯的长期自主行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27264 2026-05-01 cs.SE cs.AI 81%

Self-Evolving Software Agents

自演化软件代理

Marco Robol, Paolo Giorgini

机构 * University of Trento(特伦托大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出自演化软件代理,结合BDI推理与大语言模型,使代理能自主进化目标、推理和可执行代码。实验显示代理可自主发现新目标并生成行为,验证了LLM驱动进化的可行性与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26630 2026-04-30 cs.CL 81%

SAGE: A Strategy-Aware Graph-Enhanced Generation Framework For Online Counseling

SAGE:一种面向在线咨询的策略感知图增强生成框架

Eliya Naomi Aharon, Meytal Grimland, Avi Segal, Loona Ben Dayan, Inbar Shenfeld, Yossi Levi Belz, Kobi Gal

机构 * Ben-Gurion University of the Negev(贝叶特·沙瓦大学) University of Haifa(海法大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SAGE通过整合心理框架和实时压力信号,提升在线咨询的策略预测与响应质量,为高风险危机咨询提供决策支持工具。

Comments Full version of the work accepted as a short paper at the 34th ACM Conference on User Modeling, Adaptation and Personalization (UMAP '26). 9 pages, 4 figures, 5 tables

Journal ref Proceedings of the 34th ACM Conference on User Modeling, Adaptation and Personalization (UMAP '26), June 08--11, 2026, Gothenburg, Sweden

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25419 2026-04-29 cs.AI 81%

JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR

JURY-RL: 选票提议,证明判定用于无标签的RLVR

Xinjie Chen, Biao Fu, Jing Wu, Guoxin Chen, Xinggao Liu, Dayiheng Liu, Minpeng Liao

机构 * Zhejiang University, Hangzhou, China(浙江大学,杭州,中国) Tongyi Lab, Alibaba Group, Hangzhou, China(通义实验室,阿里巴巴集团,杭州,中国)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 JURY-RL提出一种无标签RLVR框架,通过模型回放提议候选答案,形式验证器判定是否可获正奖,从而稳定训练并提升数学推理性能。

Comments Preprint. 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏