arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-10 至 2025-12-10 共收录 25 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 25 篇

2511.10384 2025-12-10 cs.SI cs.AI cs.CL cs.CY 90%

Simulating Misinformation Propagation in Social Networks using Large Language Models

利用大语言模型模拟社交媒体上的虚假信息传播

Raj Gaurav Maurya, Vaibhav Shukla, Raj Abhijit Dandekar, Rajat Dandekar, Sreedath Panat

机构 * Vizuara AI Labs(Vizuara AI实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文利用大语言模型模拟社交媒体虚假信息传播,通过构建人格代理网络研究虚假信息演变机制,揭示身份和意识形态驱动的人格加速虚假信息扩散,专家驱动人格则保持事实稳定。

Comments Accepted to CIKM 2025 Workshop LASS

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15365 2025-12-10 cs.HC cs.AI cs.CL cs.CY 90%

Identifying Features that Shape Perceived Consciousness in Large Language Model-based AI: A Quantitative Study of Human Responses

识别塑造大语言模型基AI中感知意识的特征:人类反应的定量研究

Bongsu Kang, Jundong Kim, Tae-Rim Yun, Hyojin Bae, Chang-Eop Kim

机构 * Department of Physiology Gachon University College of Korean Medicine(生理学系高丽大学医学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过分析人类对AI意识感知的特征,揭示了元认知自我反思和情绪表达对意识感知的影响,同时指出知识过度强调会降低感知意识。

Comments 11 pages, 3 figures, 4 tables

Journal ref Computers in Human Behavior Reports, Volume 21 (2026) 100901

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08145 2025-12-10 cs.RO cs.AI 89%

Chat with UAV -- Human-UAV Interaction Based on Large Language Models

与无人机对话——基于大语言模型的人机交互

Haoran Wang, Zhuohang Chen, Guang Li, Bo Ma, Chuanghuang Li

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的双智能体HUI框架,通过任务规划和执行智能体提升无人机交互的个性化和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08480 2025-12-10 cs.CL 88%

Soft Inductive Bias Approach via Explicit Reasoning Perspectives in Inappropriate Utterance Detection Using Large Language Models

通过显式推理视角的软归纳偏见方法用于大型语言模型中的不当言论检测

Ju-Young Kim, Ji-Hong Park, Se-Yeon Lee, Sujin Park, Gun-Woo Kim

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出一种通过显式推理视角的软归纳偏见方法,用于提升大型语言模型在不当言论检测中的准确性和一致性。

Comments in Korean language, Published in the Proceedings of the 37th Annual Conference on Human and Language Technology, 2025, pp. 714-719. (English translation assisted by GPT)

Journal ref Proceedings of the 37th Annual Conference on Human and Language Technology, 2025, pp. 714-719

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07785 2025-12-10 physics.data-an cs.AI cs.LG hep-ex 86%

Automating High Energy Physics Data Analysis with LLM-Powered Agents

利用LLM代理自动化高能物理数据分析

Eli Gendreau-Distler, Joshua Ho, Dongwon Kim, Luc Tomas Le Pottier, Haichen Wang, Chengxi Yang

机构 * Department of Physics, University of California, Berkeley, Berkeley, CA 94720, USA(加州大学伯克利分校物理系) Physics Division, Lawrence Berkeley National Laboratory, Berkeley, CA 94720, USA(伯克利国家实验室物理部)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究利用LLM代理自动化高能物理数据分析,通过混合系统结合LLM和Snakemake工作流管理器,评估代理在多阶段工作流中的性能。

Comments 16 pages, 6 figures, 2 tables, the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) - Machine Learning and the Physical Sciences (ML4PS) workshop (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08536 2025-12-10 cs.AI 85%

Principles2Plan: LLM-Guided System for Operationalising Ethical Principles into Plans

Principles2Plan: 伦理原则引导的计划系统

Tammy Zhong, Yang Song, Maurice Pagnucco

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Principles2Plan通过人机协作生成基于伦理原则的可操作规则,提升自动规划的伦理实用性

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00831 2025-12-10 cs.LG 85%

ReJump: A Tree-Jump Representation for Analyzing and Improving LLM Reasoning

ReJump:一种用于分析和改进LLM推理的树跳表示

Yuchen Zeng, Shuibai Zhang, Wonjun Kang, Shutong Wu, Lynnix Zou, Ying Fan, Heeju Kim, Ziqian Lin, Jungtaek Kim, Hyung Il Koo, Dimitris Papailiopoulos, Kangwook Lee

机构 * UW-Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) FuriosaAI Seoul National University(首尔国立大学) KRAFTON

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ReJump通过树跳表示分析和改进LLM推理,揭示不同任务下的推理行为差异及学习策略的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08186 2025-12-10 cs.RO 82%

Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation

放慢脚步,快速移动:一种通用视觉-语言导航的双系统基础模型

Meng Wei, Chenyang Wan, Jiaqi Peng, Xiqian Yu, Yuqiang Yang, Delin Feng, Wenzhe Cai, Chenming Zhu, Tai Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :foundation model(title,abstract);language model(abstract)

AI总结 DualVLN通过双系统架构,结合高层推理与低层动作执行,提升视觉-语言导航的泛化能力和动态环境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12200 2025-12-10 cs.AI cs.AR 81%

PRO-V-R1: Reasoning Enhanced Programming Agent for RTL Verification

PRO-V-R1:基于推理增强的RTL验证编程代理

Yujie Zhao, Zhijing Wu, Boqin Yuan, Zhongming Yu, Hejia Zhang, Wentao Ni, Chia-Tung Ho, Haoxing Ren, Jishen Zhao

机构 * University of California San Diego(加州大学圣地亚哥分校) NVIDIA(NVIDIA公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 PRO-V-R1是一种基于推理增强的开源框架,通过结合LLM推理与编程工具,提升RTL验证的功能正确性和故障检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20781 2025-12-10 cs.SE cs.AI 81%

Using LLMs in Generating Design Rationale for Software Architecture Decisions

在软件架构决策中使用LLMs生成设计理由

Xiyu Zhou, Ruiyin Li, Peng Liang, Beiqi Zhang, Mojtaba Shahin, Zengyang Li, Chen Yang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) RMIT University(皇家墨尔本理工大学) School of Computer Science, Central China Normal University(中央师范大学计算机学院) School of Artificial Intelligence, Shenzhen Polytechnic University(深圳职业技术学院人工智能学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究评估了LLMs在生成软件架构决策设计理由方面的性能,通过实验和访谈探讨了不同提示策略的效果及实际应用的可行性。

Comments Preprint accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08659 2025-12-10 cs.CL cs.LG 79%

An Agentic AI System for Multi-Framework Communication Coding

多框架通信编码的代理AI系统

Bohao Yang, Rui Yang, Joshua M. Biro, Haoyuan Wang, Jessica L. Handley, Brianna Richardson, Sophia Bessias, Nicoleta Economou-Zavlanos, Armando D. Bedoya, Monica Agrawal, Michael M. Zavlanos, Anand Chowdhury, Raj M. Ratwani, Kai Sun, Kathryn I. Pollak, Michael J. Pencina, Chuan Hong

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出MOSAIC系统,通过多代理架构实现多框架临床沟通编码,达到高F1得分,尤其在患者行为识别上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10240 2025-12-10 cs.AI cs.CL 79%

ProgRAG: Hallucination-Resistant Progressive Retrieval and Reasoning over Knowledge Graphs

ProgRAG: 一种抗幻觉的逐步检索和知识图谱推理框架

Minbae Park, Hyemin Yang, Jeonghyun Kim, Kunsoo Park, Hyunjoon Kim

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ProgRAG通过分解复杂问题并逐步扩展推理路径,提升知识图谱问答的可靠性和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08300 2025-12-10 cs.AI 77%

rSIM: Incentivizing Reasoning Capabilities of LLMs via Reinforced Strategy Injection

rSIM: 通过强化策略注入激励大语言模型的推理能力

Sijia Chen, Baochun Li, Di Niu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Toronto(多伦多大学) University of Alberta(阿尔伯塔大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 rSIM通过强化策略注入机制,使LLM具备推理能力,并在实验中显著提升模型性能。

Comments 14 pages, 6 figures. Accepted to the ACL ARR July

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11180 2025-12-10 cs.SE cs.AI cs.ET cs.SY eess.SY 77%

Beyond Formal Semantics for Capabilities and Skills: Model Context Protocol in Manufacturing

超越能力与技能的形式语义:制造业中的模型上下文协议

Luis Miguel Vieira da Silva, Aljosha Köcher, Felix Gehlhoff

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于模型上下文协议(MCP)的制造业能力与技能建模方法,通过标准化接口实现与LLM的高效交互,提升工业自动化灵活性。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03817 2025-12-10 cs.AI cs.MA 77%

Learning to Deliberate: Meta-policy Collaboration for Agentic LLMs with Multi-agent Reinforcement Learning

学习 deliberation:基于多智能体强化学习的元策略协作用于代理语言模型

Wei Yang, Jesse Thomason

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出元策略推理框架MPDF,结合SoftRankPO算法,通过学习动态推理策略提升多智能体LLM在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08645 2025-12-10 cs.CV 75%

Chain-of-Image Generation: Toward Monitorable and Controllable Image Generation

图像生成链:迈向可监控和可控的图像生成

Young Kyung Kim, Oded Schlesinger, Yuzhou Zhao, J. Matias Di Martino, Guillermo Sapiro

机构 * Duke University(杜克大学) Princeton University(普林斯顿大学) Universidad Católica del Uruguay(乌拉圭天主教大学) Apple(苹果公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 CoIG框架通过将图像生成过程分解为可监控的步骤,提升图像生成的可控性和可解释性。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08270 2025-12-10 cs.AI cs.CL q-fin.GN 73%

Reasoning Models Ace the CFA Exams

推理模型在CFA考试中表现优异

Jaisal Patel, Yunzhe Chen, Kaiwen He, Keyi Wang, David Li, Kairong Xiao, Xiao-Yang Liu

机构 * Rensselaer Polytechnic Institute(罗格斯理工学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) SecureFinAI Lab(安全金融人工智能实验室) Columbia University(哥伦比亚大学) Business School(商学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了先进推理模型在模拟CFA考试中的表现,发现Gemini 3.0 Pro在多个考试级别均取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08026 2025-12-10 cs.AI 70%

Toward an AI Reasoning-Enabled System for Patient-Clinical Trial Matching

迈向基于AI推理的患者-临床试验匹配系统

Caroline N. Leach, Mitchell A. Klusty, Samuel E. Armstrong, Justine C. Pickarski, Kristen L. Hankins, Emily B. Collier, Maya Shah, Aaron D. Mullen, V. K. Cody Bumgardner

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于AI推理的患者-临床试验匹配系统,通过结构化评估和可解释推理链,提升匹配效率与安全性。

Comments 10 pages, 2 figures, submitted to AMIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07845 2025-12-10 cs.SD cs.AI eess.AS 70%

AudioScene: Integrating Object-Event Audio into 3D Scenes

AudioScene: 将对象事件音频整合到3D场景中

Shuaihang Yuan, Congcong Wen, Muhammad Shafique, Anthony Tzes, Yi Fang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AudioScene数据集,通过整合音频事件与3D场景,探索音频条件任务,提升空间学习的准确性与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08889 2025-12-10 cs.CV cs.AI 57%

No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers

无标签,无问题:利用多模态验证器训练视觉推理器

Damiano Marsili, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出无需标注的视觉推理训练框架,结合AI驱动的验证器提升推理与定位能力,超越现有开源和专有模型。

Comments Project webpage: https://glab-caltech.github.io/valor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08820 2025-12-10 cs.CV cs.AI 57%

Training-Free Dual Hyperbolic Adapters for Better Cross-Modal Reasoning

无需训练的双双曲适配器用于更高效的跨模态推理

Yi Zhang, Chun-Wun Cheng, Junyi He, Ke Yu, Yushun Tang, Carola-Bibiane Schönlieb, Zhihai He, Angelica I. Aviles-Rivero

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Department of Electrical and Electronic Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系) Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系) Yau Mathematical Sciences Center, Tsinghua University(清华大学应用数学中心)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出无需训练的双双曲适配器方法,通过双曲空间嵌入提升跨模态推理性能,实现更高效的领域泛化和少样本识别。

Comments Accepted in IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08228 2025-12-10 cs.CV cs.AI 57%

MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models

MM-CoT:一种用于探测多模态模型中视觉链式推理的基准测试

Jusheng Zhang, Kaitong Cai, Xiaoyang Guo, Sidi Liu, Qinhan Lv, Ruiqi Chen, Jing Yang, Yijia Fan, Xiaofei Sun, Jian Wang, Ziliang Chen, Liang Lin, Keze Wang

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) Snap Inc(Snap公司)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 MM-CoT是一种用于评估多模态模型视觉链式推理能力的基准测试,通过验证推理链的视觉一致性和逻辑一致性,揭示生成模型在真实推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08123 2025-12-10 cs.CL 57%

Universal Adversarial Suffixes Using Calibrated Gumbel-Softmax Relaxation

利用校准的Gumbel-Softmax松弛的通用对抗后缀

Sampriti Soor, Suklav Ghosh, Arijit Sur

机构 * Center for Intelligent Cyber Physical Systems(智能网络物理系统中心) Indian Institute of Technology Guwahati(印度古瓦哈提理工学院) Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文提出了一种利用校准的Gumbel-Softmax松弛学习通用对抗后缀的方法,能有效降低多种任务和模型的准确性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07094 2025-12-10 cs.AI 57%

VIGIL: A Reflective Runtime for Self-Healing Agents

VIGIL:一种用于自愈代理的反射性运行时

Christopher Cruz

机构 * Christopher Cruz

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 VIGIL是一种反射性运行时,通过自我诊断和修复机制提升代理系统的可靠性和自我维护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08860 2025-12-10 cs.CV 50%

Tri-Bench: Stress-Testing VLM Reliability on Spatial Reasoning under Camera Tilt and Object Interference

Tri-Bench:在相机倾斜和物体干扰下测试VLM在空间推理中的可靠性

Amit Bendkhale

机构 * Amit Bendkhale(独立研究者)

专题命中 推理与问题求解 :language model(abstract)

AI总结 Tri-Bench通过测试VLM在相机倾斜和物体干扰下的空间推理可靠性,揭示了模型在几何推理中的不足。

Comments 6 pages, 3 figures. Code and data: https://github.com/Amiton7/Tri-Bench. Accepted to the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏