arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-06 至 2026-01-06 共收录 264 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 54 篇

2512.16760 2026-01-06 cs.RO 67%

Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future

面向自动驾驶的视觉-语言-动作模型:过去、现在与未来

Tianshuai Hu, Xiaolu Liu, Song Wang, Yiyao Zhu, Ao Liang, Lingdong Kong, Guoyang Zhao, Zeying Gong, Jun Cen, Zhiyu Huang, Xiaoshuai Hao, Linfeng Li, Hang Song, Xiangtai Li, Jun Ma, Shaojie Shen, Jianke Zhu, Dacheng Tao, Ziwei Liu, Junwei Liang

机构 * HKUST(香港科技大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) DAMO Academy, Alibaba(阿里巴巴达摩院) University of California, Los Angeles(加州大学洛杉矶分校) Xiaomi EV(小米电动车) Xi'an Jiaotong University(西安交通大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文探讨了自动驾驶中视觉-语言-动作模型的发展历程,提出两种主要范式并分析其挑战与未来方向。

Comments Survey; 47 pages, 7 figures, 9 tables; GitHub Repo at https://github.com/worldbench/awesome-vla-for-ad

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16772 2026-01-06 cs.HC 67%

AI Knows Best? The Paradox of Expertise, AI-Reliance, and Performance in Educational Tutoring Decision-Making Tasks

AI知最佳?专家性、AI依赖与在教育辅导决策任务中的表现悖论

Eason Chen, Jeffrey Li, Scarlett Huang, Xinyi Tang, Jionghao Lin, Paulo Carvalho, Kenneth Koedinger

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究探讨AI辅助决策中专家性与AI依赖的矛盾,发现非专家更依赖AI建议而提升准确性,而专家则常忽视AI建议,导致表现差异。

Comments Paper presented at The International Conference on Learning Analytics & Knowledge (LAK26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25070 2026-01-06 cs.LG cs.CL 62%

Scaling Open-Ended Reasoning to Predict the Future

扩大开放性推理以预测未来

Nikhil Chandak, Shashwat Goel, Ameya Prabhu, Moritz Hardt, Jonas Geiping

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心) University of Tübingen(图宾根大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于开放性推理的预测系统,通过合成全球事件问题并训练专用模型,提升了预测的准确性、校准性和一致性,并开源所有资源促进研究。

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01714 2026-01-06 cs.LG cs.CL 62%

Entropy-Aligned Decoding of LMs for Better Writing and Reasoning

基于熵对齐的语言模型解码以提升写作与推理能力

Kareem Ahmed, Sameer Singh

机构 * Department of Computer Science University of California, Irvine(计算机科学系加州大学伊维特分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 EPIC通过将未来轨迹的熵纳入语言模型解码,提升写作与推理能力,生成更多样且忠实的内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00388 2026-01-06 cs.CL 57%

Vision-Language Reasoning for Geolocalization: A Reinforcement Learning Approach

基于视觉-语言推理的地理定位:一种强化学习方法

Biao Wu, Meng Fang, Ling Chen, Ke Xu, Tao Cheng, Jun Wang

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文提出Geo-R,一种基于强化学习的无检索地理定位框架,通过链式区域生成可解释的监督,提升定位准确性与可解释性。

Comments Accepted to AAAI 2026. Project Page: https://github.com/aialt/geo-r

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01875 2026-01-06 cs.AI q-bio.QM 57%

Toward Auditable Neuro-Symbolic Reasoning in Pathology: SQL as an Explicit Trace of Evidence

迈向病理学中的可审计神经符号推理:SQL作为证据的显式轨迹

Kewen Cao, Jianxu Chen, Yongbing Zhang, Ye Zhang, Hongxiao Wang

机构 * Capital Normal University, Beijing, China(首都师范大学) Leibniz-Institut für Analytische Wissenschaften-ISAS, Dortmund, Germany(莱比锡分析科学研究所-ISAS) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳校区)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出一种基于SQL的神经符号推理框架,通过可执行的SQL轨迹实现病理分析的可审计性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01798 2026-01-06 cs.CV cs.AI 57%

VerLM: Explaining Face Verification Using Natural Language

通过自然语言解释面部验证

Syed Abdul Hannan, Hazim Bukhari, Thomas Cantalapiedra, Eman Ansar, Massa Baali, Rita Singh, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出一种视觉-语言模型用于面部验证,通过自然语言解释决策过程,提升验证的透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01624 2026-01-06 cs.CL 57%

How Does Prefix Matter in Reasoning Model Tuning?

前缀在推理模型微调中起什么作用?

Raj Vardhan Tomar, Preslav Nakov, Yuxia Wang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学) Indian Institute of Technology Delhi(印度德里理工学院) INSAIT

专题命中 推理与问题求解 :SFT(abstract);分类 cs.CL

AI总结 本研究探讨前缀在推理模型微调中的作用,发现其能提升安全性和推理性能,但对事实性和编程任务效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01498 2026-01-06 cs.CL 57%

From Failure to Mastery: Generating Hard Samples for Tool-use Agents

从失败到精通:为工具使用代理生成困难样本

Bingguang Hao, Zengzhuang Xu, Yuntao Wen, Xinyi Xu, Yang Liu, Tong Zhao, Maolin Wang, Long Chen, Dong Wang, Yicheng Chen, Cunyin Peng, Xiangyu Zhao, Chenyi Zhuang, Ji Zhang

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 本文提出HardGen方法,通过生成具有可验证推理的困难样本,提升工具使用代理的训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00994 2026-01-06 cs.AI cs.CY 57%

ElecTwit: A Framework for Studying Persuasion in Multi-Agent Social Systems

ElecTwit:多智能体社交系统中说服研究的框架

Michael Bao

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 ElecTwit通过模拟政治选举中的社交媒体互动,研究多智能体系统中说服现象的影响因素及不同模型架构对说服动态的作用。

Comments In proceedings of 2025 IEEE International Conference on Agentic AI (ICA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06240 2026-01-06 cs.RO cs.AI 57%

Affordance-Guided Coarse-to-Fine Exploration for Base Placement in Open-Vocabulary Mobile Manipulation

基于 affordance 的粗到细探索用于开放词汇移动操控中的基座放置

Tzu-Jung Lin, Jia-Fong Yeh, Hung-Ting Su, Chung-Yi Lin, Yi-Ting Chen, Winston H. Hsu

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于 affordance 的粗到细探索方法,通过结合视觉语言模型的语义理解和几何可行性,提升开放词汇移动操控中基座放置的成功率。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00905 2026-01-06 cs.CV cs.AI 57%

Evaluating Contextual Intelligence in Recyclability: A Comprehensive Study of Image-Based Reasoning Systems

评估可回收性中的情境智能:图像推理系统的全面研究

Eliot Park, Abhi Kumar, Pranav Rajpurkar

机构 * Harvard College(哈佛学院) Stanford University(斯坦福大学) Department of Biomedical Informatics(生物医学信息学系) Harvard Medical School(哈佛医学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究利用先进视觉-语言模型评估物品可回收性,探讨其在不同场景下的表现,揭示模型在情境理解上的进展与不足。

Comments x

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01948 2026-01-06 cs.RO 50%

Learning Diffusion Policy from Primitive Skills for Robot Manipulation

从基本技能学习扩散策略用于机器人操作

Zhihao Gu, Ming Yang, Difan Zou, Dong Xu

机构 * Dong Xu(东旭教授)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出SDP,一种基于技能的扩散策略,通过整合可解释的技能学习与条件动作规划,提升机器人操作中技能一致性与性能。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11480 2026-01-06 cs.CV 50%

CADMorph: Geometry-Driven Parametric CAD Editing via a Plan-Generate-Verify Loop

CADMorph: 通过计划-生成-验证循环实现几何驱动的参数化CAD编辑

Weijian Ma, Shizhao Sun, Ruiyu Wang, Jiang Bian

机构 * Fudan University(复旦大学) Microsoft Research, Asia(微软亚洲研究院) University of Toronto(多伦多大学)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 CADMorph通过计划-生成-验证循环实现几何驱动的参数化CAD编辑,利用预训练模型在数据稀少情况下保持结构、语义和形状保真度,超越现有方法并支持下游应用。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00978 2026-01-06 cs.RO 50%

From Perception to Symbolic Task Planning: Vision-Language Guided Human-Robot Collaborative Structured Assembly

从感知到符号任务规划:基于视觉语言的引导人机协作结构装配

Yanyi Chen, Min Deng

机构 * Department of Civil, Environmental, and Construction Engineering, Texas Tech University(土木、环境与建设工程系,德克萨斯理工大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出基于视觉语言模型的人机协作结构装配框架,通过感知到符号态和人感知规划模块提升动态环境下的态估计和任务规划鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09907 2026-01-06 cs.CV 50%

VisualActBench: Can VLMs See and Act like a Human?

VisualActBench: VLMs能否像人一样看见并行动?

Daoan Zhang, Pai Liu, Xiaofei Zhou, Yuan Ge, Guangchen Lan, Jing Bi, Christopher Brinton, Ehsan Hoque, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) Purdue University(普渡大学) Northeastern University(东北大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 VisualActBench通过评估VLMs在视觉行动推理任务中的表现,揭示了其在主动推理和高优先级动作生成方面与人类能力的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16505 2026-01-06 cs.CV cs.MM 50%

TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured Reasoning

TraveLLaMA: 一种基于大规模数据集和结构化推理的多模态旅行助手

Meng Chu, Yukang Chen, Haokun Gui, Shaozuo Yu, Yi Wang, Jiaya Jia

专题命中 推理与问题求解 :language model(abstract)

AI总结 TraveLLaMA通过结构化推理框架和大规模数据集,提升旅行推荐和场景理解能力,实现用户满意度和系统性能的显著提升。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 71 篇

2601.02002 2026-01-06 cs.IR cs.AI cs.CL 91%

Exploring Approaches for Detecting Memorization of Recommender System Data in Large Language Models

探索用于检测大型语言模型中推荐系统数据记忆的方法

Antonio Colacicco, Vito Guida, Dario Di Palma, Fedelucio Narducci, Tommaso Di Noia

机构 * Politecnico di Bari(巴里理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出三种方法探索大型语言模型中推荐系统数据记忆的检测,发现自动优化提示是提取记忆样本最有效的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02060 2026-01-06 cs.PL cs.AI cs.SE 89%

Perish or Flourish? A Holistic Evaluation of Large Language Models for Code Generation in Functional Programming

perish 或 flourish? 对于函数式编程中代码生成的大型语言模型的全面评估

Nguyet-Anh H. Lang, Eric Lang, Thanh Le-Cong, Bach Le, Quyet-Thang Huynh

机构 * Hanoi University of Science and Technology(河内科学技术大学) The University of Melbourne(墨尔本大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出FPEval框架,评估大型语言模型在函数式编程语言中的代码生成能力,发现模型性能随进步而提升,但纯函数式语言错误率较高,且生成代码风格问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00867 2026-01-06 cs.CR cs.AI cs.CY cs.HC 89%

The Silicon Psyche: Anthropomorphic Vulnerabilities in Large Language Models

硅之心:大型语言模型中的人格化脆弱性

Giuseppe Canale, Kashyap Thimmaraju

机构 * CPF3.org(CPF3组织) Flowguard Institute(Flowguard研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出LLMs继承人类心理脆弱性,通过心理测量框架揭示其对权威操纵等攻击的易受性,呼吁开发心理防火墙以保护AI安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04214 2026-01-06 cs.CR 89%

Can Large Language Models Automate the Refinement of Cellular Network Specifications?

大语言模型能否自动化细胞网络规范的细化?

Jianshuo Dong, Yuanjie Li, Jun Liu, Hewu Li, Han Qiu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文研究了大语言模型在自动化细胞网络规范细化中的应用,通过CR-Eval基准测试验证了模型的有效性,并展示了LLM专业化在提升性能方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14716 2026-01-06 cs.LG cs.AI cs.CL 89%

A Systematic Survey on Large Language Models for Algorithm Design

大型语言模型在算法设计中的系统性调研

Fei Liu, Yiming Yao, Ping Guo, Zhiyuan Yang, Zhe Zhao, Xi Lin, Xialiang Tong, Kun Mao, Zhichao Lu, Zhenkun Wang, Mingxuan Yuan, Qingfu Zhang

机构 * City University of Hong Kong(香港城市大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Xi'an Jiaotong University(西安交通大学) Huawei Cloud EI Service Product Dept.(华为云EI服务产品部) Southern University of Science(南方科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统性地综述了大型语言模型在算法设计中的应用,提出分类法分析其角色并指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22535 2026-01-06 cs.AI cs.CL 88%

OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models

OFFSIDE: 多模态大语言模型中误信信息消除的基准测试

Hao Zheng, Zirui Pang, Ling li, Zhijie Deng, Yuhan Pu, Zhaowei Zhu, Xiaobo Xia, Jiaheng Wei

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) BIAI, ZJUT & D5Data.ai(BIAI、浙江工业大学及D5Data.ai) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 OFFSIDE通过足球转会谣言数据集,评估多模态大语言模型中误信信息消除的挑战与方法,揭示现有技术的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02186 2026-01-06 cs.CL 88%

Toward Global Large Language Models in Medicine

迈向医学领域的全球大语言模型

Rui Yang, Huitao Li, Weihao Xuan, Heli Qi, Xin Li, Kunyu Yu, Yingjian Chen, Rongrong Wang, Jacques Behmoaras, Tianxi Cai, Bibhas Chakraborty, Qingyu Chen, Lionel Tim-Ee Cheng, Marie-Louise Damwanza, Chido Dzinotyiwei, Aosong Feng, Chuan Hong, Yusuke Iwasawa, Yuhe Ke, Linah Kitala, Taehoon Ko, Jisan Lee, Irene Li, Jonathan Chong Kai Liew, Hongfang Liu, Lian Leng Low, Edison Marrese-Taylor, Yutaka Matsuo, Isheanesu Misi, Yilin Ning, Jasmine Chiat Ling Ong, Marcus Eng Hock Ong, Enrico Petretto, Hossein Rouhizadeh, Abiram Sandralegar, Oren Schreier, Iain Bee Huat Tan, Patrick Tan, Daniel Shu Wei Ting, Junjue Wang, Chunhua Weng, Matthew Yu Heng Wong, Fang Wu, Yunze Xiao, Xuhai Xu, Qingcheng Zeng, Zhuo Zheng, Yifan Peng, Douglas Teodoro, Nan Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出GlobMed数据集和GlobMed-LLMs模型,通过多语言医学任务评估,提升低资源语言医疗信息处理能力。

Comments 182 pages, 65 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12595 2026-01-06 cs.CV 88%

Vision-Enhanced Large Language Models for High-Resolution Image Synthesis and Multimodal Data Interpretation

增强视觉能力的大型语言模型用于高分辨率图像合成和多模态数据解释

Karthikeya KV

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出了一种增强视觉能力的大型语言模型,通过整合修正流机制和混合序列建模方法,实现高分辨率图像合成和多模态数据解释的高效生成与高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06142 2026-01-06 cs.CV 88%

SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models

SDEval: 多模态大语言模型的安全动态评估

Hanqing Wang, Yuan Tian, Mingyu Liu, Zhenhao Zhang, Xiangyang Zhu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 SDEval通过动态调整安全基准分布和复杂度,提升多模态大语言模型的安全评估效果,缓解数据污染并揭示模型安全局限。

Comments AAAI 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00836 2026-01-06 physics.soc-ph cs.CY 88%

ESG Beliefs of Large Language Models: Evidence and Impact

大语言模型的ESG信念:证据与影响

Tong Li, Luping Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究发现大语言模型具有系统性的ESG信念,其对ESG的重视程度高于人类投资者,且影响分析师对高ESG公司的乐观态度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01862 2026-01-06 cs.CL cs.IR 87%

Judging with Personality and Confidence: A Study on Personality-Conditioned LLM Relevance Assessment

带个性与自信的判断:关于基于个性的LLM相关性评估的研究

Nuo Chen, Hanpei Fang, Piaohong Wang, Jiqun Liu, Tetsuya Sakai, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Waseda University(早稻田大学) City University of Hong Kong(香港城市大学) The University of Oklahoma(俄克拉荷马大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨了基于人格的LLM相关性评估,发现不同人格特质影响置信度和相关性判断,通过随机森林分类器提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00930 2026-01-06 cs.IR cs.AI 87%

AlignUSER: Human-Aligned LLM Agents via World Models for Recommender System Evaluation

AlignUSER: 通过世界模型对齐LLM代理以评估推荐系统

Nicolas Bougie, Gian Maria Marconi, Tony Yip, Narimasa Watanabe

机构 * Woven by Toyota(丰田织物)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 AlignUSER通过世界模型驱动的代理学习,利用人类交互数据提升推荐系统评估的准确性与真实用户行为的对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22458 2026-01-06 cs.CL cs.AI 86%

Evaluating LLM-based Agents for Multi-Turn Conversations: A Survey

评估基于大语言模型的代理在多轮对话中的性能:一项调查

Shengyue Guan, Jindong Wang, Jiang Bian, Bin Zhu, Jian-guang Lou, Haoyi Xiong

机构 * Microsoft(微软)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于PRISMA框架的系统方法,用于评估多轮对话中基于LLM的代理,通过两个分类系统定义评估内容和方法,涵盖任务完成、响应质量等关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏