arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-09-01 至 2026-09-01 共收录 150 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 150 篇

2605.28008 2026-09-01 cs.AI cs.LG 版本更新 94%

Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training

压缩思维:压缩推理数据在LLM后训练中何时以及如何发挥作用

Kohsei Matsutani, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 推理与问题求解 :LLM(title,title_cn);SFT(summary_cn,abstract);post-training(title,abstract);large language model(abstract)

AI总结 本文通过分类显式、组合和隐式思维链,在合成组合推理任务上实验,发现粗粒度CoT需要更多SFT数据,组合和隐式CoT从数据缩放中获益更多但隐式CoT易导致记忆,后续RLVR会分解压缩步骤,且单向CoT顺序在长序列任务上泛化更强。

Comments Findings of EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06449 2026-09-01 cs.CL 版本更新 92%

An evidence-guided reinforcement learning method to improve psychiatric reasoning in small language models

评估一种证据引导的强化学习框架在对齐光参数大语言模型与精神科临床推理决策认知中的作用

Xinxin Lin, Guangxin Dai, Yi Zhong, Xiang Li, Xue Xiao, Jian Liu, Yixin Zhang, Lingming Hu, Zhengdong Wu, Yongbo Zheng, Runchuan Zhu, Ming Zhao, Huizi Yu, Yi Zhang, Fangting Lu, Shuo Wu, Jun Zhao, Ping Yin, Joey W. Y. Chan, Ngan Yin Chan, Yumei Wang, Lejin Yang, Yanqiu Xing, Sijing Chen, Yun Kwok Wing, Lin Lu, Xin Ma, Lizhou Fan

机构 * The Chinese University of Hong Kong, Shatin, N.T., Hong Kong SAR, China(香港中文大学) Shandong University, Jinan, China(山东大学) Peking University Sixth Hospital, Beijing, China(北京大学第六医院) Inspur Cloud Information Technology Co., Ltd., Jinan, China(Inspur 云技术有限公司) Fudan University, Shanghai, China(复旦大学) Shandong Provincial Hospital Affiliated to Shandong First Medical University, Jinan, China(山东第一医科大学附属山东省人民医院) Jilin University, Changchun, China(吉林大学) Hong Kong ICI Cloud Service Limited, Hong Kong SAR, China(香港ICI云服务有限公司) Shandong First Medical University, Jinan, China(山东第一医科大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract)

AI总结 本研究提出ClinMPO框架,通过证据引导的强化学习使轻量LLM在复杂精神病学推理任务中达到超越人类的准确率。

Comments 28 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30543 2026-09-01 cs.AI cs.SE 新提交 92%

Designing an Auditable LLM-Supported Workflow for Qualitative Thematic Analysis

设计一种可审计的、由大语言模型(LLM)支持的定性主题分析工作流程

Nadia Jul Jeldtoft, Tariq Yousef

机构 * University of Southern Denmark(南丹麦大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种可审计的LLM支持的定性主题分析工作流程,推导五项设计原则,构建两阶段工作流程,经半结构化丹麦访谈记录评估,其编码覆盖与人工相当,主题更紧凑,可扩展适配不同LLM与领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11635 2026-09-01 cs.CR cs.AI 版本更新 92%

FAA Framework: A Large Language Model-Based Approach for Credit Card Fraud Investigations

FAA框架:一种基于大语言模型的信用卡欺诈调查方法

Shaun Shuster, Eyal Zloof, Asaf Shabtai, Rami Puzis

机构 * Ben-Gurion University of the Negev(贝纳尔吉翁内盖夫大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究提出首个基于大语言模型的欺诈调查助手FIA框架,利用LLM能力自动化信用卡欺诈调查关键步骤,在Sparkov和CCTD数据集上经1500次额外调查后F1分数提升8%,可辅助解决模糊警报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30581 2026-09-01 cs.AI cs.LG 新提交 92%

Automated Testing of LLM-Based Post Hoc Explainers Using Model Checking as an Oracle

使用模型检验作为神谕对基于大语言模型(LLM)的事后解释器进行自动化测试

Dennis Gross, Helge Spieker

机构 * Institut für Kommunikations- und Prüfungsforschung gGmbH(通信与测试研究院(非营利有限责任公司)) Simula Research Laboratory(Simula研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出以概率模型检验为神谕、结合事后查询分类法,实现对基于LLM的事后解释器的自动化测试,在7个MDP环境中区分出不同规模LLM的解释可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09295 2026-09-01 cs.MA 版本更新 91%

MACRO-LLM: LLM-Empowered Multi-Agent Collaborative Reasoning under Spatiotemporal Partial Observability

MACRO-LLM:基于时空部分可观测性的LLM赋能多智能体协作推理

Handi Chen, Running Zhao, Xiuzhe Wu, Zhanfeng Xu, Edith C.H. Ngai

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出MACRO-LLM,通过三个模块解决多智能体在时空部分可观测性下的协作推理问题,验证了其在复杂任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29309 2026-09-01 cond-mat.mtrl-sci cs.AI physics.app-ph 新提交 91%

Evaluating LLM-based AI agents integrated with materials synthesis tools: the case of atomic layer deposition

评估集成了材料合成工具的基于大语言模型(LLM)的智能体:以原子层沉积为例

Angel Yanguas-Gil

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究以原子层沉积为案例,提出了评估集成材料合成工具的基于LLM的AI智能体的实用框架,涵盖多类基准并可推广至其他材料合成技术。

Comments Invited prospective paper submitted to MRS Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03471 2026-09-01 cs.CL cs.AI 版本更新 91%

EpiQAL: Benchmarking Large Language Models in Epidemiological Question Answering and Reasoning

EpiQAL:大型语言模型在流行病学问答与推理中的基准测试

Mingyang Wei, Dehai Min, Zewen Liu, Yuzhang Xie, Guanchen Wu, Ziyang Zhang, Carl Yang, Max S. Y. Lau, Qi He, Lu Cheng, Wei Jin

机构 * Emory University(埃默里大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Microsoft(微软公司)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(title);language model(title);prompting(abstract)

AI总结 提出EpiQAL基准,通过三个子集(事实回忆、多步推理、不完整信息下结论重建)评估LLM在流行病学推理中的表现,发现当前模型在多步推理上表现有限。

Comments Accepted to EMNLP 2026 Main Conference. 35 pages, 5 figures, 31 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08058 2026-09-01 cs.CL cs.AI 版本更新 91%

Triggering Chain-of-Thought via Latent Feature Interventions in Large Language Models

超越链式推理:大型语言模型中的一个潜在计算模式

Zhenghao He, Guangzhi Xiong, Bohan Liu, Sanchit Sinha, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)

AI总结 研究发现大型语言模型中的推理能力由潜在内部激活支持,通过引导特定潜在特征可提升性能,CoT提示并非唯一触发方式。

Comments Accepted at EMNLP' 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20624 2026-09-01 cs.AI cs.CL cs.LG stat.ML 版本更新 90%

In LLM Reasoning, there is Irrationality on top of Value Misalignment

在LLM推理中,价值对齐之上存在非理性

Kejiang Qian, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出理性价值风险概念,形式化LLM在推理中即使价值对齐也可能无法最大化对齐价值的问题,并通过实验验证该风险普遍存在且无法被对齐消除。

Comments Published in the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP) as a Main Conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30399 2026-09-01 cs.CL cs.AI 新提交 90%

SemPOI-RL: Aligning LLM Semantic Reasoning for Interpretable Out-of-Town POI Sequential Generation

SemPOI-RL:对齐大语言模型语义推理以实现可解释的异地兴趣点序列生成

Yunqi Liu, Yang Zhang, Ruixing Zhang, Liangzhe Han, Yi Qiao, Tongyu Zhu, Leilei Sun

机构 * State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) Beihang University(北京航空航天大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SemPOI-RL框架通过微调LLM、引入SPAM模块并结合推荐导向强化学习,实现LLM语义推理与结构化序列生成的对齐,在两个真实数据集上优于传统推荐器和LLM基线,可生成可解释的异地POI序列。

Comments 19 pages in total, including 9 pages of main text and 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30224 2026-09-01 cs.CL cs.AI 新提交 90%

The Differential Reasoning Router: Operationalizing Cost-Aware LLM Annotation in E-commerce

差异推理路由:在电商中实现成本感知的大语言模型标注

Cheng Lyu, Jingyue Zhang, Vinny DeGenova, Mengwei Li, Yuanli Pei

机构 * Wayfair

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对电商LLM标注冷启动问题,提出DRR框架,通过联合优化模型选择与人工升级实现自适应路由,在保持准确率的同时节约60%以上推理令牌成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29096 2026-09-01 cs.LG cs.AI 新提交 90%

Development of an Autonomous AI Coding Agent using Monte Carlo Tree Search (MCTS) and Gemini LLM Frameworks

基于蒙特卡洛树搜索(MCTS)和Gemini大语言模型框架的自主AI编码智能体开发

Pravin Game, Vipin Ramakrishnan, Prathamesh Wagh

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发了一种结合Gemini LLM与定制MCTS的自主AI编码智能体,通过自评判系统优化代码生成,在复杂逻辑任务上成功率达92%,性能优于零样本生成模型。

Comments 10 PAGES WITH PLAGIARISM REPORT ON 10TH PAGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18795 2026-09-01 cs.CL cs.AI 版本更新 90%

Decomposing Wrong-Consensus Agreement in LLM Self-Consistency

分解LLM自一致性中的错误共识一致性:GPT-4.1案例研究

Lizhuo Zhang, Mengmeng Tang, Chenfeng Long, Xiaoyong Tang, Xiang Luo

机构 * College of Information and Intelligence, Hunan Agricultural University(湖南农业大学信息与智能科学学院) Yuelushan Laboratory(岳麓山实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究以GPT-4.1为案例,将LLM自一致性的错误共识一致性分解为机械成分与偏好残差,发现难题上存在自一致性反效果,一致性为分级证据,未提出新投票方法。

Comments v2: Added controlled open-weights replication (five models, ten cells), finite-donor bias calibration, and within-family regime analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09600 2026-09-01 cs.AI cs.CL 版本更新 90%

Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation

Agora:通过基于拍卖的任务分配增强大语言模型智能体推理

Kaiji Zhou, Aleš Leonardis, Yue Feng

机构 * University of Birmingham(伯明翰大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在增强LLM智能体推理能力,提出Agora框架,通过基于拍卖的机制动态分配任务,将推理步骤视为可交易项目让智能体依纠正能力投标,实验表明该框架在多基准测试中表现优且能实现成本-质量权衡。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28006 2026-09-01 cs.CL cs.AI 版本更新 90%

Integrated and Cross-Architecture Interpretation of LLM Reasoning

LLM推理的集成与跨架构解释

Leonardo Matthew Yauw, Wei-Bin Kou, Yujiu Yang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出集成跨架构推理(IAR)框架,通过带宽校准的MIP与Tukey IQR峰值检测、重叠分析及Jaccard稳定性度量,统一解释LLM推理模式。

Comments Accepted as main conference paper by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17251 2026-09-01 cs.LG cs.AI 版本更新 90%

Training-free LLM Verification via Recycling Few-shot Examples

利用回收少样本示例实现无需训练的大语言模型验证

Dongseok Lee, Jimyung Hong, Dongyoung Kim, Jaehyung Kim

机构 * Yonsei University(延世大学) KAIST(韩国科学技术院)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM推理随机性与结论不一致的问题,提出无需训练的ReFeri框架,结合前向置信得分与后向重构惩罚,在7项任务上使3种LLM准确率平均提升8.2%。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25992 2026-09-01 cs.AI cs.MA 版本更新 90%

ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffs

ProgRouter:面向质量-成本权衡的多智能体大语言模型工作流的在线进度引导编排

Songyuan Li, Ahmed M. Abdelmoniem, Shiqiang Wang

机构 * Aston University(阿斯顿大学) Queen Mary University of London(伦敦玛丽女王大学) University of Exeter(埃克塞特大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ProgRouter是一种在线进度引导路由框架,通过多视图任务进度评分器等机制,在多智能体LLM工作流中平衡任务质量与时间、成本预算,在多类任务数据集上较基线降低运营成本且保持性能。

Comments Accepted in Findings of the Association for Computational Linguistics: EMNLP 2026. Index Terms: Collaborative agentic workflows, LLM agent orchestration, Quality-cost trade-off, Task progress prediction, Online decision-making

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30395 2026-09-01 cs.CL 新提交 90%

When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models

当大语言模型遇到树搜索:大语言模型中作为搜索的推理的系统视角

Jiaqi Wei, Xiang Zhang, Yuejin Yang, Wenxuan Huang, Juntai Cao, Sheng Xu, Xiang Zhuang, Zhangyang Gao, Muhammad Abdul-Mageed, Laks VS Lakshmanan, Chenyu You, Wanli Ouyang, Siqi Sun

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) University of British Columbia(不列颠哥伦比亚大学) Stony Brook University(石溪大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :LLM(title);large language model(title);language model(title);pretraining(abstract)

AI总结 本综述将大语言模型的推理视为搜索,系统化基于树搜索的推理进展,引入统一设计空间并倡导标准化计算报告,以优化推理权衡。

Comments Accepted by EMNLP'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29459 2026-09-01 cs.AI 新提交 90%

Toward Latent Language Model Skills Steering and Optimization: An Empirical Study

面向潜在语言模型技能的引导与优化:一项实证研究

Xunyi Jiang, Junda Wu, Yuxin Xiong, Sheldon Yu, Tong Yu, David Arbour, Ritwik Sinha, Julian McAuley, Hongyi Wen

机构 * New York University(纽约大学) Adobe Research(奥多比研究院) UC San Diego(加州大学圣迭戈分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本研究通过实证探究发现大型语言模型(LLM)的过程技能可表征为激活空间中的向量方向,且可通过向量操作实现技能引导与优化,为LLM过程技能的潜在空间操控提供了表征级视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27955 2026-09-01 cs.PL cs.CL 版本更新 90%

Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents

技能即伪代码:将技能库重构为面向LLM智能体的伪代码

Xinze Li, Yuhang Zang, Yixin Cao, Aixin Sun

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出Skill-as-Pseudocode (SaP)方法,自动将Markdown技能库转换为带类型伪代码,通过确定性质量检查解决LLM智能体在检索技能时产生的混淆循环问题,在ALFWorld任务上显著优于基线。

Comments EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29174 2026-09-01 physics.soc-ph cs.MA nlin.AO 新提交 89%

Sustained Heterogeneity: an emergent collective mechanism in LLM-driven traffic

持续异质性:大语言模型驱动交通中的一种涌现集体机制

Yujun Qi, Yangyang Guan

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究在LLM控制的交通中识别出持续异质性这一新兴集体机制,通过实验得出密度相关的关键LLM渗透率p_c,表明需在动力学层强制执行稳定性。

Comments 41 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10402 2026-09-01 cs.SE 版本更新 89%

Developer-LLM Conversations: An Empirical Study of Interactions and Generated Code Quality

开发者与大语言模型对话:交互模式与生成代码质量的实证研究

Suzhen Zhong, Ying Zou, Bram Adams

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究构建大规模开发者-LLM对话数据集CodeChat,分析开发者讨论话题、交互模式及生成代码质量的演变,发现相关问题发生率未随轮次下降,提出对话助手需跟踪开发者意图并监控代码质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29689 2026-09-01 cs.CL 版本更新 89%

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07019 2026-09-01 stat.ME cs.AI stat.AP stat.ML 版本更新 89%

Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length

延迟-响应理论模型:通过响应准确性和思维链长度评估大语言模型

Zhiyu Xu, Jia Liu, Yixin Wang, Yuqi Gu

机构 * Department of Statistics, Columbia University(哥伦比亚大学统计系) Department of Statistics, University of Michigan(密歇根大学统计系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 针对大语言模型评估问题,提出延迟-响应理论(LaRT)模型,联合考虑响应准确性和思维链长度,通过引入关键参数建模,推导高效算法估计参数,经理论和模拟研究验证其优势,实际数据评估中表现优于项目反应理论(IRT)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15741 2026-09-01 cs.NE cs.CL cs.MA 版本更新 89%

Large Language Models and Evolutionary Computation: A Critical Review of Bidirectional Interaction, Automated Algorithm Design, and Co-Adaptive Systems

基于景观与搜索行为分析的粒子群优化可解释信息处理

Dikshit Chauhan, Bapi Dutta, Indu Bala, Niki van Stein, Thomas Bäck, Anupam Yadav

机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) Department of Computer Science, Universidad de Jaén(西班牙Jaén大学计算机科学系) School of Computer and Mathematical Sciences, University of Adelaide(阿德莱德大学计算机与数学科学学院) Leiden Institute of Advanced Computer Science, University Leiden(莱顿大学先进计算机科学研究所) Department of Mathematics and Computing, Dr. B. R. Ambedkar National Institute of Technology(德拉·B·R·阿姆贝卡尔国立理工学院数学与计算系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究针对粒子群优化(PSO),提出结合探索性景观分析与搜索轨迹网络的多维度可解释性框架,经24个基准函数实验确立拓扑与参数配置指南,提升了PSO的透明度与可解释性。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00610 2026-09-01 cs.CY cs.AI 版本更新 89%

Multimodal Large Language Models Predict Urban Safety Perception but Encode Non-Neutral Demographic Priors

多模态大语言模型可预测城市安全感知,但编码非中立的人口统计先验

Ciro Beneduce, Bruno Lepri, Massimiliano Luca

机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Trento(特伦托大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 该研究验证多模态大语言模型可规模化预测城市安全感知,但发现其存在非中立人口统计先验,不同性别、种族角色下的安全判断存在系统偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29379 2026-09-01 cs.RO 新提交 89%

Bridging Semantics and Physics with Constrained LLMs for Safe and Trustworthy Robotic Manipulation

用受约束的大语言模型(LLM)弥合语义与物理鸿沟,实现安全可信的机器人操纵

Wenhao Hong, Lan Wei, Dandan Zhang

机构 * Imperial College London(帝国理工学院)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对语言引导机器人操纵的语言-动作鸿沟,通过类型化契约约束LLM决策,结合MoveIt流水线验证,在多类机器人任务上实现了优于脚本策略的安全可靠性能。

Comments ECCV Workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29956 2026-09-01 cs.CL 新提交 88%

Detecting Hidden Chain-of-Thought in Large Language Models with Linguistic, Behavioral, and Mechanistic Indicators

基于语言、行为和机制指标检测大语言模型中的隐藏思维链

Armaan Singh, Ryan Trinh Le, Jasmine Kaur, Abdullah Sultan, Edward Lue Chee Lip, Kiran Nijjer, Adnan Ahmed, Vasu Sharma

机构 * Stanford University(斯坦福大学) York University(约克大学) Facebook(脸书)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出HCDS指标,通过语言、行为和机制信号检测大语言模型的隐藏思维链,在GSM8K上验证了Qwen3-4B变体存在类潜在推理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29286 2026-09-01 cs.AI 新提交 88%

MMPCBench: Benchmarking Multimodal Large Language Models on Proactive Critique of Flawed Inputs

MMPCBench:评估多模态大语言模型对有缺陷输入的主动批判能力的基准

Jinzhe Li, Gengxu Li, Jinnan Li, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) International Center of Future Science, Jilin University(吉林大学未来科学国际中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型主动错误处理评估的空白,提出MMPCBench基准框架,测试发现主流MLLMs在主动批判上存在明显弱点,还识别出“一致性缺口”问题。

详情

展开后加载摘要…

URL PDF HTML 收藏