arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18936 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18936 篇

2502.15835 2026-05-26 cs.CL cs.AI cs.SE 84%

Pragmatic Reasoning improves LLM Code Generation

语用推理提升LLM代码生成

Zhuchen Cao, Sven Apel, Adish Singla, Vera Demberg

机构 * Max Planck Institute for Informatics Saarland Campus(马克斯·普朗克信息研究所萨尔兰州分校) Computer Science Saarland University(萨尔兰州大学计算机科学系) Max Planck Institute for Software Systems Saarland Campus(马克斯·普朗克软件系统研究所萨尔兰州分校)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出CodeRSA方法,通过局部语用竞赛对候选代码进行重排序,以解决自然语言到代码生成中的歧义问题,在多个基准测试中取得最佳平均准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12576 2026-05-26 cs.CL cs.AI 84%

Coupled Variational Reinforcement Learning for Language Model General Reasoning

耦合变分强化学习用于语言模型通用推理

Xueru Wen, Jie Lou, Yanjiang Liu, Hongyu Lin, Ben He, Xianpei Han, Le Sun, Yaojie Lu, Debing Zhang

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出CoVRL方法,通过混合采样策略耦合先验和后验分布,将变分推理与强化学习结合,以解决无验证器强化学习中探索效率低和推理轨迹与答案不一致的问题,在数学和通用推理基准上提升性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23315 2026-05-25 cs.CL cs.AI 84%

Convergence Without Understanding: When Language Models Agree on Representations but Disagree on Reasoning

没有理解的趋同:当语言模型在表示上一致但在推理上分歧时

Muhammad Usama, Dong Eui Chang

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过分析16个语言模型在800个推理问题上的表示相似性,发现模型在表示上趋同但推理策略不同,表明表示趋同反映的是共享的输入处理约束而非共享的推理策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01935 2026-05-22 cs.LG cs.AI cs.PL 84%

LiteCoOp: Lightweight Multi-LLM Shared-Tree Reasoning for Model-Serving Compiler Optimizations

LiteCoOp: 轻量级多语言模型共享树推理用于模型服务编译器优化

Annabelle Sujun Tang, Christopher Priebe, Lianhui Qin, Hadi Esmaeilzadeh

机构 * A lternative C omputing T echnologies ( ACT ) Lab(替代计算技术实验室) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出LiteCoOp,一种轻量级框架,通过将优化搜索树本身作为多语言模型协作机制,实现编译器优化过程中异构语言模型的协作,从而在降低编译成本的同时提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11461 2026-05-19 cs.AI cs.LG 84%

Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning

打破赢家通吃:合作策略优化提升大语言模型的多样化推理

Haoxuan Chen, Tianming Liang, Wei-Shi Zheng, Jian-Fang Hu

机构 * ISEE Lab, Sun Yat-sen University(中山大学ISEE实验室)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Group Cooperative Policy Optimization (GCPO)方法,通过改变训练范式从 rollout 竞争转向团队合作,提升大语言模型在推理任务中的准确性和解题多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16609 2026-05-19 cs.LG cs.AI cs.CC cs.DS 84%

Prior Knowledge Makes It Possible: From Sublinear Graph Algorithms to LLM Test-Time Methods

先验知识使其成为可能:从次线性图算法到LLM测试时方法

Avrim Blum, Daniel Hsu, Cyrus Rashtchian, Donya Saless

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Columbia University(哥伦比亚大学) Google Research(谷歌研究)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文研究了测试时增强方法中先验知识与外部信息交互的理论基础,通过将多步推理建模为知识图中的s-t连通性问题,揭示了在部分先验知识下,测试时增强步骤数量与图结构之间的关系,发现当知识图中存在小组件时,增强步骤数呈平方根增长,而当知识密度超过阈值形成大组件时,增强步骤数趋于常数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13870 2026-05-19 cs.CL cs.AI 84%

Unlocking the Potential of Diffusion Language Models through Template Infilling

通过模板填充解锁扩散语言模型的潜力

Junhoo Lee, Seungyeon Kim, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种针对扩散语言模型的模板填充方法,通过在生成响应空间中建立全局蓝图,提升了数学推理、代码生成和旅行规划等任务的性能,同时在多token生成中实现了生成质量与速度的平衡。

Comments ACL 2026 Main Conference - Long Paper, Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15041 2026-05-15 cs.AI cs.CL 84%

Case-Based Calibration of Adaptive Reasoning and Execution for LLM Tool Use

基于案例的自适应推理与执行校准:大型语言模型工具使用

Renning Pang, Tian Lan, Leyuan Liu, Piao Tong, Sheng Cao, Xiaosong Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CAST框架,通过历史执行轨迹作为结构化案例,提取复杂性和失败特征以优化推理策略,提升工具使用准确性并减少冗余推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03295 2026-05-14 cs.CL cs.AI cs.CY 84%

Language Model Goal Selection Differs from Humans' in a Self-Directed Learning Task

语言模型的目标选择与人类在自我指导学习任务中不同

Gaia Molinaro, Dave August, Danielle Perszyk, Anne G. E. Collins

机构 * University of California, Berkeley(加州大学伯克利分校) Amazon AGI Lab(亚马逊人工智能实验室)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过控制实验发现语言模型在目标选择上与人类存在显著差异,多数模型表现不佳,而人类则能逐步探索并达成多样化目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17062 2026-05-13 cs.CL cs.AI 84%

Investigating Thinking Behaviours of Reasoning-Based Language Models for Social Bias Mitigation

探究基于推理的语言模型在缓解社会偏见中的思维行为

Guoqing Luo, Iffat Maab, Lili Mou, Junichi Yamagishi

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于推理的语言模型在缓解社会偏见中的思维机制,发现两种导致偏见累积的失败模式,并提出轻量级提示方法减少偏见同时保持准确性。

Comments Due to issues found with the annotations in Section 4.3, we have decided to withdraw this preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08404 2026-05-12 cs.CL cs.AI cs.CV cs.ET 84%

Built Environment Reasoning from Remote Sensing Imagery Using Large Vision--Language Models

利用大视觉-语言模型从遥感图像中推导建成环境

Dongdong Wang, Deepak Balakrishnan, Ravi Srinivasan, Shenhao Wang

机构 * Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在智慧城市中的应用,通过多尺度遥感图像输入多模态语言模型,评估其对建成环境推理的影响,并比较了InternVL和Qwen等先进模型在生成建成环境建议中的准确性和可靠性。

Comments Published in the International Conference on Industrialized Construction 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07137 2026-05-11 cs.LG cs.AI 84%

Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR

自适应负强化用于大语言模型推理:在强化学习中动态平衡纠正与多样性

Yash Ingle, Jaival Chauhan, Ankit Yadav, Sudhakar Mishra

机构 * Sardar Vallabhbhai National Institute of Technology (SVNIT)(萨达尔·瓦拉布希·尼尔马伊技术学院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自适应负强化方法,通过时间依赖调度函数动态平衡纠正与多样性,提升大语言模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06040 2026-05-08 cs.AI cs.CL 84%

Novelty-based Tree-of-Thought Search for LLM Reasoning and Planning

基于新颖性的树状思维搜索用于大语言模型推理与规划

Leon Hamm, Zlatan Ajanovic

机构 * RWTH Aachen(亚琛工业大学)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于新颖性的树状思维搜索方法,通过引入新颖性概念优化语言领域推理与规划任务,减少搜索范围和token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04066 2026-05-08 cs.CL cs.ET cs.LG 84%

Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning

适应与繁荣!面向改进大语言模型推理的自适应幂均策略优化

Yiming Huang, Zhenbo Shi, Shuzheng Gao, Cuiyun Gao, Peiyi Han, Chuanyi Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出自适应幂均策略优化方法,通过引入幂均目标和反馈自适应裁剪,提升大语言模型的推理性能,实验显示其在多个任务中表现优于现有方法。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04212 2026-05-04 cs.CL cs.AI 84%

Language Models Struggle to Use Representations Learned In-Context

语言模型在上下文学习的表示使用上面临困难

Michael A. Lepori, Tal Linzen, Ann Yuan, Katja Filippova

机构 * Brown University(布朗大学) Google Research(谷歌研究) New York University(纽约大学) Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了语言模型是否能利用上下文学习的表示完成简单下游任务,发现开放权重模型在处理新语义表示时存在困难,即使它们在潜在表示中编码了这些语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27228 2026-05-01 cs.AI cs.CL cs.CY cs.MA 84%

When Roles Fail: Epistemic Constraints on Advocate Role Fidelity in LLM-Based Political Statement Analysis

当角色失效时:基于大语言模型的政治声明分析中的知识约束与倡导角色一致性

Juergen Dietrich

机构 * TRUST Project(TRUST项目)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于大语言模型的多智能体系统中倡导角色一致性的知识约束,通过TRUST管道测试发现两种失效模式,并揭示模型选择和事实核查提供商对角色一致性的影响。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23163 2026-04-30 cs.AI cs.CL cs.CR cs.IT cs.MA math.IT 84%

A Decision-Theoretic Formalisation of Steganography With Applications to LLM Monitoring

基于决策理论的隐写术形式化及其在大语言模型监控中的应用

Usman Anwar, Julianna Piskorz, David D. Baek, David Africa, Jim Weatherall, Max Tegmark, Christian Schroeder de Witt, Mihaela van der Schaar, David Krueger

机构 * University of Cambridge(剑桥大学) Massachusetts Institute of Technology(麻省理工学院) UK AI Safety Institute(英国人工智能安全研究所) University of Oxford(牛津大学) Mila, University of Montreal(蒙特利尔大学米尔人工智能实验室)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出决策理论视角下的隐写术形式化方法,通过通用V-信息量定义隐写差距,用于检测和缓解大语言模型中的隐写推理行为。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21459 2026-04-30 cs.LG cs.AI 84%

HER: Human-like Reasoning and Reinforcement Learning for LLM Role-playing

HER:面向大语言模型角色扮演的人类级推理与强化学习

Chengyu Du, Xintao Wang, Aili Chen, Weiyuan Li, Rui Xu, Junteng Liu, Zishan Huang, Rong Tian, Zijun Sun, Yuhao Li, Liheng Feng, Deming Ding, Pengyu Zhao, Yanghua Xiao

机构 * Fudan University(复旦大学) MiniMax

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出HER框架,通过双层推理和人类对齐的奖励模型,提升大语言模型在角色扮演中的认知模拟能力,实验表明其在CoSER和Minimax Role-Play Bench上显著优于基线模型。

Comments Findings of ACL, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02970 2026-04-21 cs.CL cs.LG 84%

Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM Reasoning

可靠性感知的自一致性自适应方法用于LLM推理中的高效采样

Junseok Kim, Nakyeong Yang, Kyungmin Min, Kyomin Jung

机构 * IPAI, Seoul National University(首尔国立大学IPAI)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出ReASC,通过将自适应采样从响应计数转向证据充分性,提升推理可靠性。在五个模型和四个数据集上,ReASC在准确率与成本之间取得最佳平衡,显著提升推理效率。

Comments ACL 2026, Code is available at https://github.com/junseokkim00/ReASC

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00065 2026-04-21 cs.CL cs.AI 84%

Using Perspectival Words Is Harder Than Vocabulary Words for Humans and Even More So for Multimodal Language Models

使用视角词比词汇词对人类更困难,甚至对多模态语言模型更为困难

Dota Tianai Dong, Yifan Luo, Po-Ya Angela Wang, Asli Ozyurek, Paula Rubio-Fernandez

机构 * Max Planck Institute for Psycholinguistics(马克斯·普朗克心理学语言学研究所)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究比较了人类和多模态语言模型在使用词汇、所有格和指示词时的认知负荷,发现视角词对两者都更难,且多模态模型在所有格和指示词上表现更差,揭示了其在常识和社交认知能力上的不足。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17068 2026-04-21 cs.CL cs.LG 84%

Stability-Weighted Decoding for Diffusion Language Models

扩散语言模型的稳定性加权解码

Yue Wu, Jian Huang

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,Location,Country) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,Location,Country) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University, Hong Kong, China(数据科学与人工智能系,香港理工大学,香港,中国)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出稳定性加权解码方法,通过引入时间稳定性提升扩散语言模型的生成准确性与鲁棒性,实验表明其在代码生成和数学推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26771 2026-04-21 cs.CL cs.LG 84%

LogicDiff: Logic-Guided Denoising Improves Zero-Shot Reasoning in Masked Diffusion Language Models

LogicDiff:逻辑引导去噪提升掩码扩散语言模型的零样本推理

Shaik Aman

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 LogicDiff通过逻辑角色引导去噪策略提升掩码扩散语言模型的零样本推理能力,显著提高GSM8K和MATH-500任务的准确率,但较少样本提示下效果受限。

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15066 2026-04-17 cs.LG cs.AI cs.MM 84%

Time-RA: Towards Time Series Reasoning for Anomaly Diagnosis with LLM Feedback

Time-RA:面向时间序列推理的异常诊断方法:基于LLM反馈

Yiyuan Yang, Zichuan Liu, Lei Song, Kai Ying, Zhiguang Wang, Tom Bamford, Svitlana Vyetrenko, Jiang Bian, Qingsong Wen

机构 * University of Oxford(牛津大学) Nanjing University(南京大学) MSRA(微软研究院) SJTU(上海交通大学) Abel AI Outsampler University of Strasbourg(斯特拉斯堡大学) Squirrel Ai Learning(Squirrel AI学习)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出Time-RA,通过引入RATs40K多模态数据集,改进时间序列异常检测的生成式推理方法,提升诊断准确性和解释性,实现可解释的多模态时间序列分析。

Comments ACL 2026 Findings. 27 pages, 11 figures, 15 tables. Code and dataset are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14631 2026-04-17 cs.CL cs.AI 84%

StoryCoder: Narrative Reformulation for Structured Reasoning in LLM Code Generation

StoryCoder: 为LLM代码生成中的结构化推理提供叙述改写

Geonhui Jang, Dongyoon Han, YoungJoon Yoo

机构 * Dept. of Artificial Intelligence, Chung-Ang University(Chung-Ang 大学人工智能系) NAVER AI Lab(NAVER AI 实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 StoryCoder通过将代码生成问题转化为连贯的自然语言叙述,提升模型推理和规划能力,实验显示在多个数据集上平均提升18.7%的零样本准确率,且改进了算法策略和代码结构。

Comments 21 pages, 12 figures. ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10905 2026-04-14 cs.SD cs.AI cs.CL eess.AS 84%

Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music

音频Flamingo Next:下一代开放音频-语言模型用于语音、声音和音乐

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Zhifeng Kong, Siddharth Gururani, Sang-gil Lee, Jaehyeon Kim, Aya Aljafari, Chao-Han Huck Yang, Sungwon Kim, Ramani Duraiswami, Dinesh Manocha, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

机构 * NVIDIA, USA(英伟达,美国) University of Maryland, USA(马里兰大学,美国)

专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 AF-Next通过改进基础模型、扩展数据集和引入时序推理方法,提升了语音、环境声音和音乐的理解与推理能力,展示了更强的性能和实用性。

Comments Project website: https://afnext-umd-nvidia.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13755 2026-04-14 cs.LG cs.AI 84%

Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration

在RLVR中深度与广度的协同作用:通过自适应探索解锁LLM推理增益

Zhicheng Yang, Zhijiang Guo, Yinya Huang, Yongxin Wang, Dongchun Xie, Hanhui Li, Yiwei Wang, Xiaodan Liang, Jing Tang

机构 * Sun Yat-Sen University(中山大学) ETH AI Center, ETH Zurich(苏黎世联邦理工学院ETH人工智能中心) University of California, Merced(加州大学默塞德分校)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DARS方法,通过自适应探索提升LLM推理能力,发现扩大批量大小能显著提升Pass@1指标,同时结合DARS-Breadth方法实现深度与广度的协同增益。

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00077 2026-04-07 cs.CL cs.LG stat.ML 84%

Gaussian mixture models as a proxy for interacting language models

高斯混合模型作为交互语言模型的代理

Edward L. Wang, Mohammad Sharifi Kiasari, Tianyu Wang, Hayden Helm, Avanti Athreya, Carey Priebe, Vince Lyzinski

机构 * Helivan Research

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出交互高斯混合模型作为交互语言模型的代理,通过构建具有类RAG更新机制的模型,展示其在低计算成本下模拟交互语言模型的反馈过程,并提供理论分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02341 2026-04-06 cs.LG cs.AI 84%

LLM Reasoning with Process Rewards for Outcome-Guided Steps

基于过程奖励的大型语言模型推理

Mohammad Rezaei, Jens Lehmann, Sahar Vahdati

机构 * Amazon Science(亚马逊科学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PROGRS框架通过过程奖励相对偏好优化,提升数学推理准确性,减少错误引导,优于仅基于结果的基线方法。

Comments 8 pages, 3 figures, 2 tables, submitted to IJCNN 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09724 2026-04-03 cs.CL cs.AI 84%

Syntactic Framing Fragility: An Audit of Robustness in LLM Ethical Decisions

句法框架脆弱性:LLM伦理决策稳健性审计

Katherine Elkins, Jon Chun

机构 * Integrated Program in Humane Studies / AIColab(人文研究综合项目 / AIColab) Computing, Kenyon College(凯尼恩学院计算系)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Syntactic Framing Fragility框架,用于量化LLM在逻辑等价句法变换下的决策一致性,发现开源模型在高风险决策中表现更脆弱,且否定性语法是主要失效模式。

Comments 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12189 2026-04-02 cs.AI cs.CL 84%

Mitigating Content Effects on Reasoning in Language Models through Fine-Grained Activation Steering

通过细粒度激活引导缓解语言模型中的内容影响

Marco Valentino, Geonhee Kim, Dhairya Dalal, Zhixue Zhao, André Freitas

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过激活引导技术缓解语言模型的推理偏见,发现对比引导方法能有效减少内容偏见,提升形式推理准确性,且在不同任务中具有鲁棒性。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏