arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-24 至 2025-12-24 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 17 篇

2512.20324 2025-12-24 cs.CL 90%

Can LLMs Solve My Grandma's Riddle? Evaluating Multilingual Large Language Models on Reasoning Traditional Bangla Tricky Riddles

LLMs能解决我奶奶的谜题吗?评估多语言大语言模型在推理传统孟加拉谜题上的能力

Nurul Labib Sayeedi, Md. Faiyaz Abdullah Sayeedi, Khushnur Binte Jahangir, Swakkhar Shatabda, Sarah Masud Preum

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究评估了多语言大语言模型在解决传统孟加拉谜题上的能力,发现其在推理任务中表现有限,但为低资源隐喻推理提供了新的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20333 2025-12-24 cs.AI q-bio.QM 89%

SynCraft: Guiding Large Language Models to Predict Edit Sequences for Molecular Synthesizability Optimization

SynCraft: 引导大语言模型预测编辑序列以优化分子合成可行性

Junren Li, Luhua Lai

机构 * BNLMS, College of Chemistry and Molecular Engineering, Peking University, Beijing 100871, China(BNLMS,化学与分子工程学院,北京大学,北京100871,中国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 SynCraft通过引导大语言模型预测编辑序列,优化分子合成可行性,提升生成分子的结构保真度和合成可行性。

Comments 28 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20586 2025-12-24 cs.AI cs.CL cs.HC 87%

Automated stereotactic radiosurgery planning using a human-in-the-loop reasoning large language model agent

利用人类在回路的推理大型语言模型代理进行自动化立体定向放射手术计划

Humza Nusrat, Luke Francisco, Bing Luo, Hassan Bagher-Ebadian, Joshua Kim, Karen Chin-Snyder, Salim Siddiqui, Mira Shah, Eric Mellon, Mohammad Ghassemi, Anthony Doemer, Benjamin Movsas, Kundan Thind

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用人类在回路的推理大型语言模型代理进行自动化立体定向放射手术计划,通过对比推理模型与非推理模型,展示了推理模型在剂量优化和计划行为上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04826 2025-12-24 cs.CL cs.AI 86%

Persistent Instability in LLM's Personality Measurements: Effects of Scale, Reasoning, and Conversation History

大语言模型人格测量中的持久不稳定性:规模、推理和对话历史的影响

Tommaso Tosato, Saskia Helbling, Yorguin-Jose Mantilla-Ramos, Mahmood Hegazy, Alberto Tosato, David John Lemay, Irina Rish, Guillaume Dumas

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在人格测量中存在持续不稳定性,规模扩大、推理和对话历史等干预措施未能有效提升稳定性。

Comments Accepted at AAAI 2026, Track on AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10110 2025-12-24 cs.CR 83%

Mastering AI: Big Data, Deep Learning, and the Evolution of Large Language Models -- Blockchain and Applications

掌握AI:大数据、深度学习与大语言模型的演变——区块链与应用

Pohsun Feng, Ziqian Bi, Lawrence K. Q. Yan, Yizhu Wen, Benji Peng, Junyu Liu, Caitlyn Heqi Yin, Tianyang Wang, Keyu Chen, Sen Zhang, Ming Li, Jiawei Xu, Ming Liu, Xuanhe Pan, Jinlang Wang, Xinyuan Song, Qian Niu

专题命中 推理与问题求解 :large language model(title);language model(title)

AI总结 本文探讨了区块链技术的基础、应用及挑战,分析了其在金融、供应链等领域的实际应用,并讨论了可扩展性和未来发展方向。

Comments This book contains 241 pages and 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24347 2025-12-24 cs.CL eess.AS 79%

Fewer Hallucinations, More Verification: A Three-Stage LLM-Based Framework for ASR Error Correction

更少的幻觉,更多的验证:一种基于LLM的三阶段框架用于语音识别错误纠正

Yangui Fang, Baixu Chen, Jing Peng, Xu Li, Yu Xi, Chengwei Zhang, Guohui Zhong

机构 * Huazhong University of Science and Technology, School of Electronic Information and Communications(华中科技大学电子信息与通信学院) MoE Key Lab of Artificial Intelligence, AI Institute, X-LANCE Lab, Shanghai Jiao Tong University, Shanghai, China(人工智能联合实验室、AI研究院、X-LANCE实验室、上海交通大学) AISpeech Ltd, Suzhou, China(上海苏州AISpeech有限公司)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出一种基于LLM的三阶段框架,用于减少语音识别错误纠正中的幻觉问题,通过预检测、链式思维修正和推理验证提高纠正准确性。

Comments This paper has been ACCEPTED for publication in ASRU

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17266 2025-12-24 cs.CL cs.AI 79%

Select2Reason: Efficient Instruction-Tuning Data Selection for Long-CoT Reasoning

Select2Reason: 为长链推理实现高效的指令微调数据选择

Cehao Yang, Xueyuan Lin, Xiaojun Wu, Chengjin Xu, Xuhui Jiang, Honghao Liu, Hui Xiong, Jian Guo

机构 * DataArc Tech Ltd.(DataArc科技有限公司) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) IDEA Research, International Digital Economy Academy(IDEA研究所,国际数字经济学院) Hithink RoyalFlush Information Network Co., Ltd(Hithink RoyalFlush信息网络有限公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Select2Reason通过高效数据选择提升长链推理性能,实验证明其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20417 2025-12-24 cs.CV cs.MA 78%

Chain-of-Anomaly Thoughts with Large Vision-Language Models

基于大视觉-语言模型的异常思维链

Pedro Domingos, João Pereira, Vasco Lopes, João Neves, David Semedo

机构 * NOVALINCS, NOVA School of Science and Technology(NOVALINCS、NOVA科学与技术学院) NOVALINCS, Universidade da Beira Interior(NOVALINCS、贝拉内尔大学) DeepNeuronic

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出CoAT框架,通过引入异常偏见提升大视觉-语言模型在异常检测和分类任务中的性能。

Comments 2 pages, 3 figures, 1 table. Accepted for RECPAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20275 2025-12-24 cs.AI cs.NI 77%

Graph-Symbolic Policy Enforcement and Control (G-SPEC): A Neuro-Symbolic Framework for Safe Agentic AI in 5G Autonomous Networks

图符号政策执行与控制(G-SPEC):一种用于5G自治网络安全代理AI的神经符号框架

Divya Vijay, Vignesh Ethiraj

机构 * NetoAI Solutions Ltd(NetoAI解决方案有限公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 G-SPEC是一种神经符号框架,通过确定性验证约束概率规划,提升5G自治网络中代理AI的安全性和可靠性。

Comments 15 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01457 2025-12-24 cs.LG cs.AI cs.CL 75%

Zero-Overhead Introspection for Adaptive Test-Time Compute

无开销的适应性测试时间计算 introspection

Rohin Manvi, Joey Hong, Tim Seyde, Maxime Labonne, Mathias Lechner, Sergey Levine

机构 * UC Berkeley(加州大学伯克利分校) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Liquid AI

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ZIP-RC通过无开销的实时自我反省预测奖励和成本,提升推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23129 2025-12-24 cs.LG cs.AI cs.CL 75%

C$^2$GSPG: Confidence-calibrated Group Sequence Policy Gradient towards Self-aware Reasoning

C$^2$GSPG:基于置信度校准的群体序列策略梯度方法,用于自感知推理

Haotian Liu, Shuo Wang, Hongteng Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高陵人工智能学院) Tsinghua University(清华大学) Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 C$^2$GSPG通过置信度校准群体序列策略梯度方法提升推理性能并抑制过度自信,适用于逻辑和数学推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20184 2025-12-24 cs.DC 71%

Reaching Agreement Among Reasoning LLM Agents

使推理LLM代理达成一致

Chaoyi Ruan, Yiliang Wang, Ziji Shi, Jialin Li

专题命中 推理与问题求解 :LLM(title)

AI总结 Aegean通过引入基于共识的协议,为多代理推理提供正式模型,有效减少延迟并保持答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19742 2025-12-24 cs.LG 70%

On-device Large Multi-modal Agent for Human Activity Recognition

用于人体活动识别的设备端大多模态智能体

Md Shakhrul Iman Siam, Ishtiaque Ahmed Showmik, Guanqun Song, Ting Zhu

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种用于人体活动识别的设备端大多模态智能体,结合大语言模型提升性能与可解释性,实现高分类准确率和用户友好交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19280 2025-12-24 cs.CV 67%

RemoteReasoner: Towards Unifying Geospatial Reasoning Workflow

RemoteReasoner: 向统一地理空间推理流程迈进

Liang Yao, Fan Liu, Hongbo Lu, Chuanyi Zhang, Rui Min, Shengxiang Xu, Shimin Di, Pai Peng

机构 * COWARobot

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 RemoteReasoner通过强化学习实现统一地理空间推理流程,具备多粒度任务处理能力和自主推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20618 2025-12-24 cs.AI cs.CV cs.LG cs.MA 62%

LongVideoAgent: Multi-Agent Reasoning with Long Videos

LongVideoAgent: 多智能体推理与长视频

Runtao Liu, Ziyi Liu, Jiaqi Tang, Yue Ma, Renjie Pi, Jipeng Zhang, Qifeng Chen

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 LongVideoAgent通过多智能体框架实现长视频的多模态推理,利用强化学习提升多智能体协作效率,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01801 2025-12-24 cs.RO cs.LG 57%

GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation

GR-RL:为长周期机械操作实现灵活与精确

Yunfei Li, Xiao Ma, Jiafeng Xu, Yu Cui, Zhongren Cui, Zhigang Han, Liqun Huang, Tao Kong, Yuxiao Liu, Hao Niu, Wanli Peng, Jingchao Qiao, Zeyu Ren, Haixin Shi, Zhi Su, Jiawen Tian, Yuyang Xiao, Shenyu Zhang, Liwei Zheng, Hang Li, Yonghui Wu

机构 * ByteDance(字节跳动)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.LG

AI总结 GR-RL通过多阶段训练管道,将通用VLA策略转化为擅长长周期精确操作的专家策略,成功实现自主系鞋带任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18885 2025-12-24 cs.PL 50%

A Minimalist Proof Language for Neural Theorem Proving over Isabelle/HOL

为Isabelle/HOL上的神经定理证明设计的最小化证明语言

Qiyuan Xu, Renxi Wang, Peixin Wang, Haonan Li, Conrad Watt

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文提出Minilang,一种简洁的证明语言,用于提升神经定理证明在形式证明中的性能。

Comments Accepted in OOPSLA'26

详情

展开后加载摘要…

URL PDF HTML 收藏