arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-27 至 2026-08-27 共收录 53 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 53 篇

2608.25220 2026-08-27 cs.AI cs.LO math.OC 新提交 92%

FLARE: Verifying MILP Reformulations with LLM-Based Theorem Proving

FLARE:基于大语言模型定理证明的MILP重构验证方法

Henry Robbins, Connor Lawless, Madeleine Udell, Ellen Vitercik

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出FLARE方法,结合LLM智能体与Lean证明助手验证MILP重构,在FormulationBench的NP-难子集达100%准确率,还提出无需证书的FLARE-NL,为自动化优化建模提供可靠验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26036 2026-08-27 cs.AI cs.CL 新提交 90%

Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems

LLM数据智能体的追踪完整性:现实世界系统中可审计结构化推理的愿景

Srimonti Dutta, Akshata Kishore Moharir

机构 * WAI USA Research Labs(WAI美国研究实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文针对LLM数据智能体提出追踪完整性标准,结合执行契约实现,通过CAIT率实验表明需同时评估答案准确率与可审计计算,为现实系统的LLM数据智能体提供评估方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25992 2026-08-27 cs.AI cs.MA 新提交 90%

ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffs

ProgRouter:面向质量-成本权衡的多智能体大语言模型工作流的在线进度引导编排

Somgyuan Li, Ahmed M. Abdelmoniem, Shiqiang Wang

机构 * Aston University(阿斯顿大学) Queen Mary University of London(伦敦玛丽女王大学) University of Exeter(埃克塞特大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ProgRouter是一种在线进度引导路由框架,通过多视图任务进度评分器等机制,在多智能体LLM工作流中平衡任务质量与时间、成本预算,在多类任务数据集上较基线降低运营成本且保持性能。

Comments Accepted in Findings of the Association for Computational Linguistics: EMNLP 2026. Index Terms: Collaborative agentic workflows, LLM agent orchestration, Quality-cost trade-off, Task progress prediction, Online decision-making

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25039 2026-08-27 cs.AI 新提交 90%

LifePlanner: Evaluating LLM Agents for Geo-spatial Planning with Social Media Data

LifePlanner:利用社交媒体数据评估LLM智能体的地理空间规划能力

Zhen Dong, Yuning Peng, Yutao Shi, Lei Zhong, Yongsen Mao, Yuan Liu, Haiping Wang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究推出LifePlanner基准测试,结合社交媒体数据评估LLM智能体的地理空间规划能力,发现前沿LLM在简单检索中表现好但复杂规划通过率仅40.2%,失败源于证据获取、工具使用及约束整合问题,需改进实际规划能力而非单纯扩大模型规模。

Comments 25 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24889 2026-08-27 cs.AI 新提交 90%

Reliable LLM-Powered Decision Engines for Large-Scale Supply Chain Operations: Architecture, Safety, and Performance Guarantees

面向大规模供应链运营的可靠大语言模型驱动决策引擎:架构、安全性与性能保证

Nirmal Kumar Jingar

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大规模供应链的不确定性等挑战,提出结合LLM与优化等的LLM-DE架构,实现更智能、安全、可扩展的供应链决策,为下一代智能供应链提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24001 2026-08-27 cs.AI 版本更新 90%

Diverse by Reasoning: Harnessing the Wisdom of LLM Crowds for Future Prediction

通过推理实现多样性:利用大语言模型群体的智慧进行未来预测

Nirupam Chetlapalli, Yiming Liao, Min-Chun Chen, Keke Chen

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出感知行为框架构建多样化LLM群体,用K-means++聚类选代表,三模型群体预测性能优于全部25模型的投票,降本提效,凸显群体构成与代表性多样性的重要性。

Comments 13 pages, 4 figures, 5 tables. Submitted to IEEE BigData 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25379 2026-08-27 cs.CL cs.AI 新提交 89%

Adaptive Triggering for Bias Correction in LLM Reasoning

大语言模型推理中用于偏差校正的自适应触发机制

Nayoung Kim, Mickey Mancenido, Huan Liu

专题命中 推理与问题求解 :LLM(title,summary_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM推理中思维链提示引发的偏差问题,提出基于在线变点检测的自适应触发校正框架,在gpt-4o-mini等模型上验证了其在减少干预次数的同时保留准确率的优势。

Comments 10 pages, 6 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25771 2026-08-27 cs.HC cs.LG 新提交 89%

Large Language Model Few-Shot Prompting with Dilemma Training Outperforms Human Surrogates in Predicting Patient Preferences

采用困境训练的大语言模型少样本提示在预测患者偏好方面优于人类替代者

Natasha Ureyang, Sebastian Porsdam Mann, Yuxin Liu, Zuriel Hassirim, Melanie Almonte, Wenhao Chen, Joyce Ng, Thant Nay Lin, Aung Thiha, Gerald CH Koh, Brian David Earp, Pin Sym Foong

专题命中 推理与问题求解 :large language model(title);language model(title);prompting(title);分类 cs.LG

AI总结 该研究提出采用困境训练的P4-DT智能体,通过12组患者-替代者配对实验,其预测患者治疗选择的准确率达81.7%,优于人类替代者及相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25660 2026-08-27 cs.CL cs.AI 新提交 88%

Think-Probe-Respond: Improving Large Language Models as Judges of Research Idea Novelty

Think-Probe-Respond:提升大型语言模型作为研究创意新颖性评判者的能力

Tim Schopf, Tobias Schreieder, Akiko Aizawa

机构 * National Institute of Informatics(情报研究综合研究所) TU Dresden(德累斯顿工业大学) ScaDS.AI Dresden/Leipzig(德累斯顿/莱比锡应用数据科学中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型评判研究创意新颖性时的“中等新颖”偏差,提出TPR轻量方法,通过探测推理阶段隐藏状态的潜在评判约束最终响应,使性能提升22.30%。

Comments Accepted to EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03542 2026-08-27 cs.CL cs.AI 版本更新 88%

Layer-Order Inversion: Rethinking Latent Multi-Hop Reasoning in Large Language Models

层序倒置:重新思考大语言模型中的潜在多跳推理

Xukai Liu, Ye Liu, Jipeng Zhang, Yanghai Zhang, Kai Zhang, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出"层序倒置"现象,通过概率性回忆与提取框架解释大语言模型中多跳推理的机制,揭示了层序倒置与总跳步数的关系,并提供了多跳失败的诊断方法。

Comments 16 pages, 18 figures, EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25277 2026-08-27 cs.CL cs.AI 新提交 88%

Routed Graph Handoff: Adaptive Format Selection for Multi-Agent LLM Delegation

路由图交接:多智能体大语言模型委派的自适应格式选择

Pratyay Banerjee, Ankit Chadha

机构 * Amazon(亚马逊)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本研究针对多智能体 LLM 协调的高 token 开销问题,提出路由图交接方法,通过轻量级 LLM 路由器在图与自然语言间自适应选择,在多基准测试中实现性能提升或持平,且开销极低。

Comments Accepted in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15987 2026-08-27 cs.LG cs.AI 版本更新 88%

AlgoTrace: Algorithmic Primitives and Compositional Geometry of Reasoning in Language Models

语言模型中推理的算法原语与组合几何

Samuel Lippl, Thomas McGee, Kimberly Lopez, Ziwen Pan, Pierce Zhang, Salma Ziadi, Oliver Eberle, Ida Momennejad

机构 * Microsoft Research NYC(微软研究院纽约分部) Center for Theoretical Neuroscience(理论神经科学中心) Department of Psychology(心理学系) University of California Los Angeles(加州大学洛杉矶分校) Institute for Pure and Applied Mathematics(纯粹与应用数学研究所) Emory University(埃默里大学) Rice University(里士满大学) Mount Holyoke College(马里兰霍克学院) Technische Universität Berlin(柏林技术大学) BIFOLD-Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析语言模型中的算法原语,揭示其推理过程的组合几何结构,并展示原语在跨任务和跨模型中的可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26865 2026-08-27 stat.ML cs.AI cs.IT cs.LG 版本更新 86%

Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

短思考、智能延迟、行动与循环:面向边缘大语言模型智能体的校准推理与感知不确定性的延迟机制

Amirmohammad Farzaneh, Osvaldo Simeone

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 该研究提出TSDS框架,结合收敛探测器与困惑度延迟规则,经LTT流程校准后,可在边缘LLM智能体上减少43%-73%的思考计算量,同时保证奖励与云端调用率,在多类基准任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25099 2026-08-27 math.OC math.DS 新提交 86%

A Control-Theoretic Approach for Resource-Aware Consensus in Multi-Agent AI

面向多智能体AI中资源感知共识的控制论方法

James Flagg, Esteban A. Hernandez-Vargas

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对LLM-MAS共识性能与计算资源关联保证不足的问题,提出将集体信念动态表征为离散时间切换系统的控制论方法,构建共识-预算证书区域,实现资源感知的多智能体协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17172 2026-08-27 cs.NE 版本更新 86%

Automating Parent Selection Configuration in Genetic Programming with Agentic AI

用智能体人工智能实现遗传编程中父代选择配置的自动化

Jose Guadalupe Hernandez, Jui-Hsuan Chang, Anil Kumar Saini, Xi Li, Jason H. Moore

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出智能体AI框架,结合LLM推理与RAG实现遗传编程父代选择配置自动化,经符号回归测试,5 mini--AR配置表现优于锦标赛选择,为进化系统自动化设计提供了新路径。

Comments Updated Benchmarking figure with correct statistical test results

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21054 2026-08-27 cs.AI cs.CL 版本更新 85%

Reasoning or Rambling? Exploring the Effect of Thinking on Agent Persuasion

推理还是漫谈?探究思考过程对智能体说服能力的影响

Haodong Zhao, Jidong Li, Zhaomin Wu, Tianjie Ju, Zhuosheng Zhang, Bingsheng He, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) National University of Singapore(新加坡国立大学) Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文对比通用LLM与LRM,发现推理对智能体说服能力存在二元性影响,还揭示其依赖表面线索的漏洞,提出提示级对抗性论点检测方法以提升鲁棒性。

Comments Accepted as EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25392 2026-08-27 cond-mat.mtrl-sci 新提交 85%

Interpretable physics-informed retrieval-augmented generation language model for end-to-end inorganic crystal synthesis planning

用于端到端无机晶体合成规划的可解释物理信息增强检索生成语言模型

Wei-Jian Jiang, Ye-Nan Sha, Hui Guo, Jie Chen, Yu-Cai Liang, Ke Zhou, Qi-Long Gao, Dong-Lin Han, Xin-Gao Gong, Wan-Jian Yin

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract)

AI总结 本研究开发可解释PIRAG-LM模型,构建含13820种晶体的SSKB,合成方法预测准确率达91.4%,指导合成5种新化合物,为材料发现与实验搭建桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17648 2026-08-27 cs.AI 版本更新 84%

From Brewing to Resolution: Tracing the Internal Lifecycle of Code Reasoning in LLMs

从酝酿到解析:追踪LLM中代码推理的内部生命周期

Siyue Chen, Yifu Guo, Yuquan Lu, Zishan Xu, Jiaye Lin, Jianbo Lin, Siyu Zhang, Cheng Yang, Junxin Li, Yujia Li, Yu Huo, Ruixuan Wang

机构 * South China University of Technology(华南理工大学) Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hangzhou Dianzi University(杭州电子科技大学) Guangzhou College of Technology and Business(广州工商学院)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 提出双重诊断框架(逐层线性探针与上下文剥离解码),揭示LLM在代码推理中先酝酿答案后进入四种解析结果(已解析、过度处理、错误解析、未解析)的内部生命周期,发现酝酿支架稳定而解析成功随能力变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25177 2026-08-27 cs.SD cs.AI 新提交 83%

AudioLens: Multi-Perspective Speech Clustering with Reasoning Audio-Language Models

AudioLens:基于推理音频-语言模型的多视角语音聚类

Wenjun Huang, Qiaosong Chu, Tiger Shao, Pengfei Zhang, Yutong Song, Hanning Chen, Yezi Liu, Weiyi Wu, SungHeon Jeong, Ryozo Masukawa, Sanggeon Yun, Yang Ni, Jiang Gui, Mohsen Imani

机构 * University of California, Irvine(加利福尼亚大学欧文分校) Dartmouth College(达特茅斯学院) Purdue University Northwest(普渡大学西北分校)

专题命中 推理与问题求解 :language model(title,abstract);preference optimization(abstract);分类 cs.AI

AI总结 该研究提出音频多视角聚类任务,构建基准AudioLens-Bench,开发经推理蒸馏和偏好优化训练的AudioLens-R1模型,实验显示其在语音聚类任务中性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25487 2026-08-27 cs.CL cs.IR 新提交 81%

ReliableRAG: Combating Misinformation in Retrieval-Augmented Generation via Reliability-Guided Reasoning Chains

ReliableRAG:通过可靠性引导推理链对抗检索增强生成中的错误信息

Jinpu Jiang, Xuan Wu, Wenhao Song, Bo Yang, You Zhou, Hongwei Ge, Heow Pueh Lee, Yanchun Liang, Chunguo Wu

机构 * College of Software, Jilin University(吉林大学软件学院) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院 教育部符号计算与知识工程重点实验室) College of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) National University of Singapore(新加坡国立大学) School of Computer Science, Zhuhai College of Science and Technology(珠海科技学院计算机学院)

专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL

AI总结 ReliableRAG是首个通过细粒度评估三元组缓解多跳问答中欺骗性错误信息的可靠性驱动框架,可提升RAG系统的事实可靠性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25276 2026-08-27 cs.CL 新提交 81%

Groundhog Bit-Flip Attack: Seeding Infinite Generation Loops in Mixture-of-Experts LLMs through Bit Flips

土拨比特翻转攻击:通过比特翻转在混合专家大语言模型中植入无限生成循环

Huakang Lin, Tiancheng Zheng, Mingxuan Sun, Tianhong Xu, Fan Zhang, Yunsi Fei, Ruyi Ding

机构 * Louisiana State University(路易斯安那州立大学) Northeastern University(东北大学) Zhejiang University(浙江大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Southeast University(东南大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出首个针对混合专家大语言模型的土拨比特翻转攻击,通过翻转路由层相关比特,可使平均输出膨胀率达5912%,揭示了MoE架构的鲁棒性漏洞。

Comments 9 pages, 3 figures; Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24958 2026-08-27 cs.SD cs.AI cs.CL 新提交 81%

Can We Read the Mind of an Audio LLM? A Verbalizable, Multilingual Middle-Layer Workspace

我们能否解读音频大语言模型的思维?一个可解读的多语言中间层工作空间

Jiajun Fan, Jingyuan Li, Prashanth Gurunath Shivakumar, Qi Luo, Jia-Hong Huang, M. Maruf, Roger Ren, Yile Gu, Rahul Pandey, Ge Liu, Ivan Bulyko

机构 * Amazon AGI Foundations(亚马逊AGI基金会) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过logit lens分析Qwen3-Omni模型,发现其中间层可在输出前清晰呈现音频问题答案,揭示了音频模型推理的特性与信号分布,为解读音频大语言模型内部思维提供了定性依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25711 2026-08-27 cs.CR 新提交 80%

Reassembling Distributed Risk: Trajectory-Conditioned Action Generation for Multi-Turn Agent Safety

重构分布式风险:面向多轮智能体安全的轨迹条件动作生成

Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对多轮分解攻击下使用工具的LLM智能体的安全风险,提出生成时防御方法ReDiR,通过轨迹级安全条件整合跨轮安全信息,将攻击成功率降至8%以下,可迁移且开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25573 2026-08-27 cs.DB cs.SE 新提交 80%

DBcover: A White-box SQL Test Generation Framework for Coverage Improvement

DBcover:一种用于提升覆盖率的白盒SQL测试生成框架

Yankai Rong, Shuang Liu, Jinhao Dong, Qiang Yin, Wei Lu, Jianhua Wang, Xiaoyong Du

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对RDBMS测试覆盖率提升难题,提出LLM驱动的白盒SQL测试生成框架DBcover,经实验在PostgreSQL、MySQL及KingbaseES上均实现有效覆盖率提升。

Comments Accepted to the ICSE 2026 Industry Challenge Track. 12 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08462 2026-08-27 cs.CR cs.PL cs.SE 版本更新 80%

QLCoder: A Query Synthesizer For Static Analysis of Security Vulnerabilities

QLCoder:一种用于静态分析安全漏洞的查询生成器

Claire Wang, Ziyang Li, Saikat Dutta, Mayur Naik

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 QLCoder通过结合LLM与执行反馈,利用MCP接口生成有效的安全查询,有效检测漏洞。在111个Java项目中,53.4%的CVE被正确识别,优于仅使用Claude Code的10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25311 2026-08-27 cs.LG 新提交 79%

Prefix-Denoising Consistency: Test-Time Verification for Diffusion Language Models

前缀去噪一致性:扩散语言模型的测试时验证方法

Yuki Ichihara, Naoto Iwase, Mohammad Atif Quamar, Junpei Komiyama

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Nagoya University(名古屋大学) RIKEN AIP(理化学研究所人工智能项目)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 该研究针对扩散语言模型提出测试时自验证方法PDC,通过前缀条件再生的轨迹稳定性差异修正初始生成样本,在两类推理基准中提升性能且具鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21147 2026-08-27 cs.SD cs.AI 版本更新 79%

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?

AOR-Bench: 大型音频语言模型是否会过度拒绝伪有害查询?

Jiaxi Yang, Chaewan Chun, Jason Lucas, Yuchen Yang, Dongwon Lee

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 提出首个针对大型音频语言模型过度拒绝问题的基准AOR-Bench,包含3000个伪有害音频样本,评估12个模型发现过度拒绝普遍存在,并探索了两种轻量缓解策略。

Comments To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25457 2026-08-27 cs.CR cs.AI cs.MA 新提交 77%

MACGen: Toward Functionally Correct and Secure Code Generation via Multi-Agent Collaboration

MACGen:通过多智能体协作实现功能正确且安全的代码生成

Miseon Yu, Jaehoon Choi, Younghan Lee, Yunheung Paek

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 MACGen是整合规划等多环节的多智能体代码生成框架,在CWEval、BaxBench基准上,较直接提示显著提升安全代码生成的功能与安全性指标。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26053 2026-08-27 cs.RO cs.AI cs.CL cs.LG 新提交 75%

$R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning

R^3:通过强化学习训练机器人以自然语言进行推理

Lehong Wu, Yuxiao Qu, Zheyuan Hu, Ivan Zhang, Limin Wei, Zackory Erickson, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :foundation model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出R^3方法,通过中间训练和基于准则的强化学习将VLM转化为机器人推理器,在两个测试平台上提升了机器人的探索与泛化能力,优于仅指令式的模仿学习基线。

Comments 42 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25832 2026-08-27 cs.CL cs.AI cs.GT cs.LG 新提交 75%

Skill Issue: Are Skills Language-Invariant in LLMs?

技能问题:大型语言模型的技能是否具有语言不变性?

Bobby Cheng, Adam Gaber, Zhengyuan Liu, Catherine Arnett, Omer Goldman, Cheston Tan, Leshem Choshen

机构 * A*STAR(新加坡科技研究局) Weizmann Institute of Science(魏茨曼科学研究所) MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室) University of Cambridge(剑桥大学) EleutherAI

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究以多语言自博弈方法量化大型语言模型的跨语言技能不一致性,发现同一模型在不同语言下博弈实力差异显著,语言可影响决策阶段,技能差异是多语言模型开发的主要障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏