arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-19 至 2025-12-19 共收录 195 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 28 篇

2512.15816 2025-12-19 cs.PL cs.AI cs.LO 70%

A Neurosymbolic Approach to Loop Invariant Generation via Weakest Precondition Reasoning

通过最弱前条件推理的神经符号方法生成循环不变式

Daragh King, Vasileios Koutavas, Laura Kovacs

机构 * Trinity College Dublin(都柏林三一学院) Lero, Research Ireland Centre for Software(爱尔兰软件研究中心) Faculty of Informatics, TU Wien(信息学院,维也纳技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NeuroInv通过结合神经推理和符号验证方法,高效生成循环不变式,成功率达到99.5%,在复杂验证场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15776 2025-12-19 cs.AI cs.MA cs.RO 70%

Emergence: Overcoming Privileged Information Bias in Asymmetric Embodied Agents via Active Querying

涌现:通过主动查询克服不对称具身智能体中的特权信息偏差

Shaun Baek, Sam Liu, Joseph Ukpong

机构 * Emory University(埃默里大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过主动查询机制解决不对称具身智能体中的特权信息偏差问题,揭示了沟通接地错误对协作成功率的影响。

Comments 12 pages, 9 pages of content, 6 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15728 2025-12-19 q-fin.GN cs.AI 70%

FedSight AI: Multi-Agent System Architecture for Federal Funds Target Rate Prediction

FedSight AI:用于联邦基金目标利率预测的多智能体系统架构

Yuhan Hou, Tianji Rao, Jeremy Tan, Adler Viton, Xiyue Zhang, David Ye, Abhishek Kodi, Sanjana Dulam, Aditya Paul, Yikai Feng

机构 * Duke University(杜克大学) BNY AI Hub

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FedSight AI通过多智能体框架和Chain-of-Draft扩展,利用大型语言模型预测联邦基金利率,实现高准确率和稳定性,优于现有基线模型。

Comments NeurIPS 2025 Generative AI in Finance Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07420 2025-12-19 math.HO cs.AI cs.HC math.GR math.LO 70%

Advancing mathematics research with generative AI

用生成式人工智能推动数学研究

Lisa Carbone

机构 * Department of Mathematics, Rutgers University(数学系,罗格斯大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了生成式人工智能在数学研究中的应用,包括其作为交互式助手的功能以及与神经符号求解器等工具的整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20978 2025-12-19 cs.AI cs.LO cs.SC 70%

Scaling Neuro-symbolic Problem Solving: Solver-Free Learning of Constraints and Objectives

规模化神经符号问题求解:无求解器学习约束与目标

Marianne Defresne, Romain Gambardella, Sophie Barbe, Thomas Schiex

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种可微神经符号架构和损失函数,用于高效学习解决NP难推理问题,通过概率损失同时学习约束和目标,实现可扩展训练和高精度推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16584 2025-12-19 cs.CV 67%

Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs

Sketch-in-Latents: 在潜在空间中实现多模态统一推理

Jintao Tong, Jiaqi Gu, Yujing Lou, Lubin Fan, Yixiong Zou, Yue Wu, Jieping Ye, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 SkiLa通过在潜在空间中实现多模态统一推理,扩展MLLMs的自回归能力,生成连续视觉嵌入,提升视觉任务性能和多模态泛化能力。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02500 2025-12-19 cs.SE 67%

Automating Automotive Software Development: A Synergy of Generative AI and Model-Based Methods

自动化汽车软件开发:生成式AI与基于模型的方法的协同

Fengjunjie Pan, Yinglei Song, Long Wen, Nenad Petrovic, Krzysztof Lebioda, Alois Knoll

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出结合生成式AI与基于模型的方法,自动化汽车软件开发,通过事件链描述生成软件组件并提升系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16144 2025-12-19 cs.LG cs.AI 62%

INTELLECT-3: Technical Report

INTELLECT-3:技术报告

Prime Intellect Team, Mika Senghaas, Fares Obeid, Sami Jaghouar, William Brown, Jack Min Ong, Daniel Auras, Matej Sirovatka, Jannik Straube, Andrew Baker, Sebastian Müller, Justus Mattern, Manveer Basra, Aiman Ismail, Dominik Scherm, Cooper Miller, Ameen Patel, Simon Kirsten, Mario Sieg, Christian Reetz, Kemal Erdem, Vincent Weisser, Johannes Hagemann

机构 * Prime Intellect, Inc.(Prime Intellect公司)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.AI、cs.LG

AI总结 INTELLECT-3是一款通过大规模强化学习训练的混合专家模型,开源了模型和基础设施栈,并引入了prime-rl框架以支持大规模异步强化学习。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15751 2025-12-19 cs.LG cs.AI cs.MA 62%

GLOW: Graph-Language Co-Reasoning for Agentic Workflow Performance Prediction

GLOW:基于图-语言协同推理的代理工作流性能预测

Wei Guan, Jian Cao, Jinyu Cai, Qiqi Cai, Jianqi Gao, See-Kiong Ng

机构 * School of Computer Science, Shanghai Jiao Tong University, China(上海交通大学计算机科学学院) Institute of Data Science, National University of Singapore, Singapore(新加坡国立大学数据科学研究所) School of Computer Engineering and Science, Shanghai University, China(上海大学计算机工程与科学学院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 GLOW通过结合图神经网络与大语言模型,提出了一种统一的代理工作流性能预测框架,有效捕捉拓扑依赖和语义逻辑,提升预测准确性与排序效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16237 2025-12-19 cs.AI 57%

Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis

通过程序化数据合成提升大规模语言模型的空间推理能力

Zhi Helu, Huang Jingjing, Xu Wang, Xu Yangbin, Zhang Wanyue, Jiang Baoyang, Deng Shirui, Zhu Liang, Li Fangfang, Zhao Tiejun, Lin Yankai, Yao Yuan

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua University(清华大学) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院电子学研究所) Renmin University of China(中国人民大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Central South University(中南大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 SPRITE通过程序化数据合成生成高质量空间推理数据,提升大规模语言模型的空间推理能力,并在多个基准测试中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16304 2025-12-19 cs.SD 50%

CogSR: Semantic-Aware Speech Super-Resolution via Chain-of-Thought Guided Flow Matching

CogSR: 通过思维链引导的流匹配实现语义感知的语音超分辨率

Jiajun Yuan, Xiaochen Wang, Yuhang Xiao, Yulin Wu, Chenhao Hu, Xueyang Lv

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University, Wuhan, China(多媒体软件国家工程研究中心、计算机科学学院、武汉大学、武汉) School of Artificial Intelligence, Jianghan University, Wuhan, China(人工智能学院、江汉大学、武汉) Xiaomi Corporation, Beijing, China(小米公司、北京)

专题命中 推理与问题求解 :language model(abstract)

AI总结 CogSR通过整合大型音频-语言模型和思维链推理,实现语义感知的语音超分辨率,提升低采样率录音的修复精度和语言准确性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16302 2025-12-19 cs.RO 50%

ManiLong-Shot: Interaction-Aware One-Shot Imitation Learning for Long-Horizon Manipulation

ManiLong-Shot:交互感知的一次学习方法用于长周期操控

Zixuan Chen, Chongkai Gao, Lin Shao, Jieqi Shi, Jing Huo, Yang Gao

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 ManiLong-Shot通过交互感知原语分解实现长周期操控任务的一次学习,有效提升机器人任务执行能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 40 篇

2503.22821 2025-12-19 cs.SE 90%

Identifying and Mitigating API Misuse in Large Language Models

识别和缓解大语言模型中的API误用

Terry Yue Zhuo, Junda He, Jiamou Sun, Zhenchang Xing, David Lo, John Grundy, Xiaoning Du

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出Dr.Fix方法,通过分类法指导LLM自动修复生成代码中的API误用问题,提升修复精度。

Comments Accepted at IEEE Transactions on Software Engineering (TSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01329 2025-12-19 cs.CL cs.AI 90%

Evaluating Large Language Models in Crisis Detection: A Real-World Benchmark from Psychological Support Hotlines

评估大型语言模型在危机检测中的表现:来自心理支持热线的现实世界基准测试

Guifeng Deng, Shuyin Rao, Tianyu Lin, Anlu Dai, Pan Wang, Junyi Xie, Haidong Song, Ke Zhao, Dongwu Xu, Zhengdong Cheng, Tao Li, Haiteng Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PsyCrisisBench,通过评估540个标注转录文本,测试64种LLM在危机检测任务中的表现,发现LLM在自杀计划识别和风险评估中表现优异,但情绪状态识别仍具挑战性。

Comments Preprint. Submitted to IEEE Journal of Biomedical and Health Informatics (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16816 2025-12-19 cs.SE 89%

Toward Systematic Counterfactual Fairness Evaluation of Large Language Models: The CAFFE Framework

迈向大型语言模型系统性反事实公平性评估:CAFFE框架

Alessandra Parziale, Gianmario Voria, Valeria Pontillo, Gemma Catolino, Andrea De Lucia, Fabio Palomba

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 CAFFE框架通过结构化和意图感知的方法系统评估大型语言模型的反事实公平性,提升了公平性检测的广度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16029 2025-12-19 cs.CY cs.AI cs.CL 88%

Cross-Language Bias Examination in Large Language Models

大语言模型中的跨语言偏见检验

Yuxuan Liang, Marwa Mahmoud

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Glasgow(格拉斯哥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了一种多语言偏见评估框架,通过显性与隐性偏见测量揭示LLM在不同语言中的偏见差异,强调隐性偏见检测的重要性,为公平多语言LLM的发展提供方法基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15250 2025-12-19 cs.CL cs.AI 88%

EMNLP: Educator-role Moral and Normative Large Language Models Profiling

EMNLP: 教育者角色道德与规范大型语言模型画像

Yilin Jiang, Mingzi Zhang, Sheng Jin, Zengyi Yu, Xiangjie Kong, Binghao Tu

机构 * College of Education, Zhejiang University of Technology(浙江工业大学教育学院) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Faculty of Education, East China Normal University(华东师范大学教育学院) GuangHua Law School, ZheJiang University(浙江大学光华法学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出EMNLP框架,用于评估教育者角色LLM的伦理和心理一致性,通过构建88个教师特定道德困境,揭示教师角色LLM在道德推理和情感复杂情境中的表现差异。

Comments 29pages, 15 figures, Accepted by EMNLP Main Confrence

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20990 2025-12-19 cs.CE cs.AI cs.MM 88%

FinAudio: A Benchmark for Audio Large Language Models in Financial Applications

FinAudio: 一个用于金融应用的音频大语言模型基准

Yupeng Cao, Haohang Li, Yangyang Yu, Shashidhar Reddy Javaji, Yueru He, Jimin Huang, Qianqian Xie, Fabrizio Dimino, Xiao-yang Liu, K. P. Subbalakshmi, Meikang Qiu, Sophia Ananiadou, Jian-Yun Nie

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Columbia University(哥伦比亚大学) The Fin AI(Fin AI公司) Domyn(Domyn公司) Augusta University(奥古斯塔大学) The University of Manchester(曼彻斯特大学) University of Montreal(蒙特利尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 FinAudio是一个用于评估音频大语言模型在金融领域应用的基准,通过三个任务和两个数据集评估七种模型,揭示了现有模型的局限性并提供改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16030 2025-12-19 cs.AI 88%

Do Large Language Models Know What They Don't Know? Kalshibench: A New Benchmark for Evaluating Epistemic Calibration via Prediction Markets

大型语言模型知道它们不知道什么吗?Kalshibench:通过预测市场评估知识校准的新基准

Lukas Nel

机构 * Lotus AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究发现大型语言模型普遍存在过度自信问题,表明知识校准需要专门发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15894 2025-12-19 cs.AI 88%

PediatricAnxietyBench: Evaluating Large Language Model Safety Under Parental Anxiety and Pressure in Pediatric Consultations

儿童焦虑基准:在儿科咨询中评估大语言模型在父母焦虑和压力下的安全性

Vahideh Zolfaghari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 PediatricAnxietyBench评估大语言模型在父母焦虑和压力下的安全性,发现70B模型在诊断和紧急情况识别方面表现更优,但所有模型均存在现实压力下的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01050 2025-12-19 cs.DB 88%

AutoDDG: Automated Dataset Description Generation using Large Language Models

AutoDDG:利用大语言模型实现自动化数据集描述生成

Haoxiang Zhang, Yurong Liu, Aécio Santos, Wei-Lun Hung, Juliana Freire

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 AutoDDG利用大语言模型自动生成数据集描述,提升数据集检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16022 2025-12-19 cs.AI 87%

Conversational Time Series Foundation Models: Towards Explainable and Effective Forecasting

对话式时间序列基础模型:迈向可解释且有效的预测

Defu Cao, Michael Gee, Jinbo Liu, Hengxuan Wang, Wei Yang, Rui Wang, Yan Liu

机构 * University of Southern California(南加州大学) Amazon AWS(亚马逊AWS)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种对话式时间序列基础模型,通过智能法官机制协调集成模型,提升预测的可解释性和效果。

Comments 31Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09149 2025-12-19 cs.CL cs.AI 86%

MindShift: Analyzing Language Models' Reactions to Psychological Prompts

MindShift: 分析语言模型对心理提示的反应

Anton Vasiliuk, Irina Abdullaeva, Polina Druzhinina, Anton Razzhigaev, Andrey Kuznetsov

机构 * FusionBrain Lab(融合大脑实验室) Applied AI Institute(应用人工智能研究院) Innopolis University(因诺普里斯大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 MindShift通过评估语言模型对心理提示的反应,揭示了模型在心理适应性和人格模拟方面的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15251 2025-12-19 cs.SE 85%

Input Reduction Enhanced LLM-based Program Repair

输入减少增强的基于大语言模型的程序修复

Boyang Yang, Luyao Ren, Xin Yin, Jiadong Ren, Haoye Tian, Shunfu Jin

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出ReduceFix方法,通过减少故障诱导输入提升基于LLM的程序修复性能,实验表明其在多个基准上显著提高了修复准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21557 2025-12-19 cs.CL 84%

Generation-Time vs. Post-hoc Citation: A Holistic Evaluation of LLM Attribution

生成时间与事后引用:对大语言模型归属的全面评估

Yash Saxena, Raviteja Bommireddy, Ankur Padia, Manas Gaur

机构 * UMBC(美国马里兰大学伯克利分校) IIITDM(印度印度理工学院迪瓦德分校)

专题命中 评测与基准 :LLM(title,comments);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估了生成时间引用与事后引用在大语言模型归属中的性能差异,发现P-Cite在覆盖和正确性上表现更优,而G-Cite更适用于精度要求高的场景。

Comments NeurIPS 2025 LLM Evaluation Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16041 2025-12-19 cs.CL cs.AI 81%

Are We on the Right Way to Assessing LLM-as-a-Judge?

我们是否在正确地评估LLM作为裁判?

Yuanning Feng, Sinan Wang, Zhengxiang Cheng, Yao Wan, Dongping Chen

机构 * Huazhong University of Science and Technology(华中科技大学) University of Maryland(马里兰大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Sage评估套件,通过局部和全局一致性指标评估LLM作为裁判的可靠性,发现当前先进模型在复杂情况下存在显著偏好不一致问题,并揭示情境偏好现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22737 2025-12-19 cs.CV cs.AI 79%

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

CompareBench: 一个用于评估视觉比较推理能力的视觉-语言模型基准

Jie Cai, Kangning Yang, Lan Fu, Jiaming Ding, Jinlong Li, Huiming Sun, Daitao Xing, Jinglin Shen, Zibo Meng

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 CompareBench是一个用于评估视觉-语言模型中视觉比较推理能力的基准,揭示了当前模型在时间排序、空间关系和基本计数上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01396 2025-12-19 cs.HC cs.AI cs.IR 79%

Easy Come, Easy Go? Examining the Perceptions and Learning Effects of LLM-based Chatbot in the Context of Search-as-Learning

易得易失?在搜索即学习情境下考察基于大语言模型的聊天机器人感知与学习效果

Yeonsun Yang, Ahyeon Shin, Mincheol Kang, Jiheon Kang, Xu Wang, Jean Y. Song

机构 * Computer Science and Engineering, University of Michigan(密歇根大学计算机科学与工程系) Humanities, Arts, and Social Sciences, Yonsei University(延世大学人文、艺术与社会科学系)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本研究探讨了基于大语言模型的聊天机器人在搜索即学习情境下的感知与学习效果,发现尽管即时回答提升了学习效率,但并未导致长期知识保留的劣化。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16795 2025-12-19 cs.CL cs.AI cs.CY cs.IR 79%

From Facts to Conclusions : Integrating Deductive Reasoning in Retrieval-Augmented LLMs

从事实到结论:在检索增强的大语言模型中整合演绎推理

Shubham Mishra, Samyek Jain, Gorang Mehrishi, Shiv Tiwari, Harsh Sharma, Pratik Narang, Dhruv Kumar

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种增强RAG框架,通过结构化推理和冲突分析提升模型在冲突信息下的回答准确性与可解释性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16553 2025-12-19 cs.AI cs.CL 79%

Needle in the Web: A Benchmark for Retrieving Targeted Web Pages in the Wild

网络中的针:评估在真实世界中检索和推理网页的基准测试

Yumeng Wang, Tianyu Fan, Lingrui Xu, Chao Huang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Needle in the Web 是一个评估现代搜索代理和LLM在模糊探索性查询中检索和推理真实网页能力的基准测试,揭示了当前搜索系统在处理模糊性和复杂性时的挑战。

Comments Data and code are available at https://github.com/Tango-Whiskyman/Needle_in_the_Web

详情

展开后加载摘要…

URL PDF HTML 收藏