arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-29 至 2026-01-29 共收录 210 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 8 篇

2502.13369 2026-01-29 cs.CL 85%

Reducing Hallucinations in Language Model-based SPARQL Query Generation Using Post-Generation Memory Retrieval

通过生成后记忆检索减少基于语言模型的SPARQL查询生成中的幻觉

Aditya Sharma, Christopher J. Pal, Amal Zouaq

机构 * Polytechnique Montréal(蒙特利尔理工学院) Mila - Quebec AI Institute(魁北克人工智能研究院) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出PGMR框架,通过生成后记忆检索减少语言模型生成SPARQL查询时的URI幻觉,提升查询准确性和系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17702 2026-01-29 cs.CL cs.LG 79%

S$^3$-Attention:Attention-Aligned Endogenous Retrieval for Memory-Bounded Long-Context Inference

S$^3$-Attention:基于注意力对齐的内源检索用于内存受限的长上下文推理

Qingsen Ma, Dianyun Wang, Yaoye Wang, Lechen Ning, Sujie Zhu, Xiaohang Zhang, Jiaming Lyu, Linhao Ren, Zhenbo Xu, Zhaofeng He

机构 * bupt(北京邮电大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 S3-Attention通过内存优先的内源检索方法,解决长上下文推理中的内存和噪声效率问题,提升模型在信息密集场景下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20831 2026-01-29 cs.AI cs.RO 77%

MemCtrl: Using MLLMs as Active Memory Controllers on Embodied Agents

MemCtrl: 使用 MLLMs 作为具身智能体的主动内存控制器

Vishnu Sashank Dorbala, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学 College Park分校)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 MemCtrl 通过使用 MLLMs 的可训练内存头 μ 实现在线内存修剪,提升具身智能体在复杂指令下的任务完成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20846 2026-01-29 cs.CL 77%

Are LLMs Really Not Knowledgeable? Mining the Submerged Knowledge in LLMs' Memory

LLMs真的不具有知识性吗?挖掘LLMs记忆中的潜藏知识

Xingjian Tao, Yiwei Wang, Yujun Cai, Zhicheng Yang, Jing Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) University of California, Merced(加州大学默塞德分校) The University of Queensland(昆士兰大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文研究LLMs在问答任务中保留潜藏知识的现象,提出Hits@k指标评估潜在知识保留,发现LLMs实际知识量远超标准QA准确率,揭示提示策略对正确答案的抑制效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03578 2026-01-29 cs.MA cs.AI 74%

LLM Multi-Agent Systems: Challenges and Open Problems

大语言模型多智能体系统:挑战与开放问题

Shanshan Han, Qifan Zhang, Weizhao Jin, Zhaozhuo Xu

机构 * University of California, Irvine, CA, USA(加州大学尔湾分校) University of Southern California, Los Angeles, CA, USA(南加州大学) Stevens Institute of Technology, Hoboken, NJ, USA(史蒂文斯理工学院)

专题命中 长上下文与记忆 :LLM(title);分类 cs.AI

AI总结 本文研究了多智能体系统在任务分配、推理增强和内存管理方面的挑战,并探讨其在区块链中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20282 2026-01-29 cs.LG 70%

Memory Retrieval in Transformers: Insights from The Encoding Specificity Principle

Transformer中的记忆检索:来自编码特异性原理的见解

Viet Hung Dinh, Ming Ding, Youyang Qu, Kanchana Thilakarathna

机构 * University of Sydney(悉尼大学) Data61 CSIRO(Data61澳大利亚联邦科学与工业研究组织)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究基于编码特异性原理,探讨了Transformer中注意力层的记忆机制,并通过实验验证了关键词作为提示的假设,为隐私保护机器无学习提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20326 2026-01-29 cs.CL cs.AI cs.LG 67%

Beyond Speedup -- Utilizing KV Cache for Sampling and Reasoning

超越加速 -- 利用KV缓存进行采样与推理

Zeyu Xing, Xing Li, Hui-Ling Zhen, Mingxuan Yuan, Sinno Jialin Pan

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出将KV缓存作为轻量级表示用于采样与推理,展示了其在链式嵌入和快速/缓慢思考切换任务中的有效性,显著提升了推理效率。

Comments Accepted by ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 35 篇

2601.20757 2026-01-29 cs.CL 90%

Persona Prompting as a Lens on LLM Social Reasoning

作为LLM社会推理的镜像:人格提示

Jing Yang, Moritz Hechtbauer, Elisabeth Khalilov, Evelyn Luise Brinkmann, Vera Schmitt, Nils Feldhus

专题命中 推理与问题求解 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究探讨了人格提示对LLM社会推理的影响,发现其虽能提升分类效果,但会降低推理质量并加剧偏见。

Comments 9 Pages, EACL main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21293 2026-01-29 cs.RO cs.HC 89%

Quadrupped-Legged Robot Movement Plan Generation using Large Language Model

四足机器人运动计划生成使用大语言模型

Muhtadin, Vincentius Gusti Putu A. B. M., Ahmad Zaini, Mauridhi Hery Purnomo, I Ketut Eddy Purnama, Chastine Fatichah

机构 * Institut Teknologi Sepuluh Nopember(十月份十号技术学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出利用大语言模型生成四足机器人运动计划,通过分布式架构和实时传感器融合实现直观自然语言导航,实验显示系统在多种场景中成功率超过90%。

Journal ref 2025 International Conference on Computer Engineering, Network and Intelligent Multimedia (CENIM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20856 2026-01-29 cs.AI 88%

SokoBench: Evaluating Long-Horizon Planning and Reasoning in Large Language Models

SokoBench:评估大型语言模型的长周期规划与推理能力

Sebastiano Monti, Carlo Nicolini, Gianni Pellegrini, Jacopo Staiano, Bruno Lepri

机构 * Ipazia SpA(Ipazia公司) University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 SokoBench通过简化俄罗斯方块谜题评估大型语言模型的长周期规划与推理能力,揭示了其在复杂任务中的性能限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20141 2026-01-29 cs.CY cs.AI 88%

Large language models accurately predict public perceptions of support for climate action worldwide

大型语言模型能准确预测全球对气候行动的支持感知

Nattavudh Powdthavee, Sandra J. Geiger

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 大型语言模型能准确预测全球对气候行动的支持感知,为评估气候行动中的感知差距提供快速工具,尤其在资源丰富的国家可作为替代调查手段。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09785 2026-01-29 cs.AI 87%

AI Annotation Orchestration: Evaluating LLM verifiers to Improve the Quality of LLM Annotations in Learning Analytics

AI标注协调:评估LLM验证器以提高学习分析中LLM标注的质量

Bakhtawar Ahtisham, Kirk Vanacore, Jinsook Lee, Zhuqian Zhou, Doug Pietrzak, Rene F. Kizilcec

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过评估LLM验证器提升学习分析中标注质量,提出灵活的协调框架和实证比较方法,展示验证在提高标注可靠性中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20194 2026-01-29 cs.HC 86%

An Autonomous Agent Framework for Feature-Label Extraction from Device Dialogues and Automatic Multi-Dimensional Device Hosting Planning Based on Large Language Models

基于大语言模型的自主代理框架:用于设备对话中特征-标签提取与自动多维设备托管规划

Huichao Men, Yizhen Hu, Yu Gao, Xiaofeng Mou, Yi Xu, Xinhua Xiao

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract)

AI总结 本文提出AirAgent框架,利用大语言模型实现家庭空气系统的自主管理,通过双层协作架构提升空气质量和用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01146 2026-01-29 cs.CL cs.AI cs.LG 83%

mR3: Multilingual Rubric-Agnostic Reward Reasoning Models

mR3:多语言无评分标准奖励推理模型

David Anugraha, Shou-Yi Hung, Zilu Tang, Annie En-Shiun Lee, Derry Tanti Wijaya, Genta Indra Winata

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学) Boston University(波士顿大学) Ontario Tech University(安大略技术大学) Monash University Indonesia(墨尔本大学印尼分校) Capital One(Capital One公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 mR3是一种多语言无评分标准奖励推理模型,通过72种语言训练实现广泛语言覆盖,超越更大模型并验证其在多语言奖励模型基准上的最佳性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20659 2026-01-29 cs.CL cs.MA 83%

A Dialectic Pipeline for Improving LLM Robustness

辩证管道用于提升大语言模型鲁棒性

Sara Candussio

机构 * Università degli Studi di Trieste(特里埃斯特大学)

专题命中 推理与问题求解 :LLM(title);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出一种辩证管道,通过自我对话提升大语言模型的鲁棒性,有效减少幻觉并提高输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20641 2026-01-29 cs.AI 83%

Investigating the Development of Task-Oriented Communication in Vision-Language Models

探究视觉-语言模型中以任务为导向的交流发展

Boaz Carmeli, Orr Paradise, Shafi Goldwasser, Yonatan Belinkov, Ron Meir

机构 * Technion – Israel Institute of Technology(技术ion–以色列理工学院) EPFL(苏黎世联邦理工学院) University of California, Berkeley(加州大学伯克利分校) Harvard University(哈佛大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究视觉-语言模型在协作任务中发展以任务为导向的通信协议的潜力与风险

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17641 2026-01-29 cs.CL cs.AI cs.LG cs.SD 82%

AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?

AuditoryBench++: 语言模型能否在不听觉的情况下理解听觉知识?

Hyunjong Ok, Suho Yoo, Hyeonjun Kim, Jaeho Lee

机构 * Pohang University of Science and Technology(坡山科学技术大学) HJ AILAB Korea Advanced Institute of Science and Technology(韩国高级科学技术研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AuditoryBench++通过AIR-CoT方法提升语言模型在听觉知识推理中的表现。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20206 2026-01-29 cs.AI 79%

Towards Intelligent Urban Park Development Monitoring: LLM Agents for Multi-Modal Information Fusion and Analysis

面向智能城市公园发展监测:LLM代理用于多模态信息融合与分析

Zixuan Xiao, Chunguang Hu, Jun Ma

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本研究提出基于LLM的多模态代理框架,用于提升城市公园发展监测中多模态数据的融合与分析能力,解决传统方法在高级分析和灵活适应性方面的不足。

Journal ref IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2025, Aug 3-8 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20270 2026-01-29 cs.CR cs.AI 77%

Eliciting Least-to-Most Reasoning for Phishing URL Detection

诱发最小到最大推理以检测钓鱼网址

Holly Trikilis, Pasindu Marasinghe, Fariza Rashid, Suranga Seneviratne

机构 * University of Sydney(悉尼大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出了一种最小到最大提示框架,通过引入答案敏感性机制提升钓鱼网址检测的推理能力和准确性,优于一次性方法和监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19061 2026-01-29 cs.CR cs.LG 77%

Thought-Transfer: Indirect Targeted Poisoning Attacks on Chain-of-Thought Reasoning Models

思维转移:链式思维推理模型的间接针对性污染攻击

Harsh Chaudhari, Ethan Rathbun, Hanna Foerster, Jamie Hayes, Matthew Jagielski, Milad Nasr, Ilia Shumailov, Alina Oprea

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种名为思维转移的新型攻击方法,通过操纵不同任务学习的推理痕迹,对链式思维推理模型进行间接针对性污染攻击,成功影响目标任务的输出并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13332 2026-01-29 cs.CL 77%

The Imitation Game: Turing Machine Imitator is Length Generalizable Reasoner

模仿游戏:图灵机模仿器是长度可推广的推理机

Zhouqi Hua, Wenwei Zhang, Chengqi Lyu, Yuzhe Gu, Songyang Gao, Kuikun Liu, Dahua Lin, Kai Chen

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TAIL方法,通过合成图灵机执行过程的链式思维数据,提升LLM的长度泛化能力,超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08477 2026-01-29 cs.CL 77%

Read as You See: Guiding Unimodal LLMs for Low-Resource Explainable Harmful Meme Detection

读取即可见:引导单模LLM进行低资源可解释有害迷因检测

Fengjun Pan, Xiaobao Wu, Tho Quan, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Ho Chi Minh City University of Technology(胡志明市技术大学) VinUniversity(文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 U-CoT+通过轻量级单模LLM和高保真迷因到文本管道,实现低资源、可解释的有害迷因检测,有效提升模型灵活性和适应性。

Comments Accepted to ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19620 2026-01-29 cs.LG cs.AI 76%

R^3: Replay, Reflection, and Ranking Rewards for LLM Reinforcement Learning

R^3: 为大语言模型强化学习的回放、反思与奖励排名

Zhizheng Jiang, Kang Zhao, Weikai Xu, Xinkui Lin, Wei Liu, Jian Luan, Shuo Shang, Peng Han

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Unaffiliated(无隶属机构) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 推理与问题求解 :LLM(title);分类 cs.AI、cs.LG

AI总结 R^3通过回放、反思和奖励排名机制,提升大语言模型在强化学习中的稳定性和效率,实现数学领域性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19851 2026-01-29 cs.RO 75%

Where Did I Leave My Glasses? Open-Vocabulary Semantic Exploration in Real-World Semi-Static Environments

我放哪里了我的眼镜?在现实世界半静态环境中进行开放式词汇语义探索

Benjamin Bogenberger, Oliver Harrison, Orrin Dahanaggamaarachchi, Lukas Brunke, Jingxing Qian, Siqi Zhou, Angela P. Schoellig

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出了一种适用于半静态环境的开放式词汇语义探索系统,通过概率模型和大语言模型推理实现高效对象导航和地图维护。

Journal ref IEEE RA-L, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04207 2026-01-29 cs.LG cs.AI cs.CL cs.CV 75%

Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning

推动多模态推理:从优化冷启动到分阶段强化学习

Shuang Chen, Yue Guo, Zhaochen Su, Yafu Li, Yulun Wu, Jiacheng Chen, Jiayu Chen, Weijie Wang, Xiaoye Qu, Yu Cheng

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Soochow University(苏州大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ReVisual-R1,通过优化冷启动和分阶段强化学习提升多模态推理能力,在多个挑战性基准测试中取得新突破。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14957 2026-01-29 cs.CV 75%

Neuro Symbolic Knowledge Reasoning for Procedural Video Question Answering

用于过程视频问答的神经符号知识推理

Basura Fernando, Thanh-Son Nguyen, Hong Yang, Tzeh Yuan Neoh, Hao Zhang, Ee Yeo Keat

机构 * Centre for Frontier AI Research, A*STAR, Singapore(前沿人工智能研究所以(A*STAR)) Institute of High-Performance Computing, A*STAR, Singapore(高性能计算研究所(A*STAR)) College of Computing and Data Science, NTU, Singapore(计算与数据科学学院(NTU))

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出KML框架,通过神经符号方法提升过程视频问答的推理能力,结合知识图谱实现可解释的多步骤推理。

Comments This paper is under review at IEEE Transactions on Neural Networks and Learning Systems. Personal use is permitted, but republication/redistribution requires IEEE permission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20467 2026-01-29 cs.AI cs.CL 73%

CtrlCoT: Dual-Granularity Chain-of-Thought Compression for Controllable Reasoning

CtrlCoT:用于可控推理的双粒度推理链压缩

Zhenxuan Fan, Jie Cao, Yang Dai, Zheqi Lv, Wenqiao Zhang, Zhongle Xie, Peng LU, Beng Chin Ooi

机构 * Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 CtrlCoT通过双粒度方法实现高效可控推理,结合语义抽象与标记级删除,提升推理效率和可靠性。

Comments 16 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18631 2026-01-29 cs.AI cs.CL cs.CV cs.MA 73%

AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning

AdaReasoner: 多步骤视觉推理中的动态工具协调

Mingyang Song, Haoyu Sun, Jiawei Gu, Linjie Li, Luxin Xu, Ranjay Krishna, Yu Cheng

机构 * Fudan University(复旦大学) Tongji University(同济大学) National University of Singapore(新加坡国立大学) University of Washington(华盛顿大学) University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AdaReasoner通过动态工具协调提升多模态模型的视觉推理能力,实现工具自适应和泛化,超越现有系统性能。

Comments 28 pages, 10 figures and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09332 2026-01-29 cs.RO cs.AI cs.CL cs.CV 73%

OmniEVA: Embodied Versatile Planner via Task-Adaptive 3D-Grounded and Embodiment-aware Reasoning

OmniEVA:通过任务自适应3D grounded和 embodiment-aware推理实现具身 versatile规划

Yuecheng Liu, Dafeng Chi, Shiguang Wu, Zhanguang Zhang, Yuzheng Zhuang, Bowen Yang, He Zhu, Lingfeng Zhang, Pengwei Xie, David Gamaliel Arcos Bravo, Yingxue Zhang, Jianye Hao, Xingyue Quan

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 OmniEVA通过任务自适应3D grounding和具身aware推理,解决具身系统中几何适应性和具身约束的限制,实现先进的具身推理和任务规划。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18944 2026-01-29 cs.AI cs.PL cs.SE 70%

Neural Theorem Proving for Verification Conditions: A Real-World Benchmark

为验证条件进行神经定理证明:一个现实世界的基准测试

Qiyuan Xu, Xiaokun Luan, Renxi Wang, Joshua Ong Jun Leang, Peixin Wang, Haonan Li, Wenda Li, Conrad Watt

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) MBZUAI Imperial College London(帝国理工学院) East China Normal University(华东师范大学) University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出NTP4VC,首个现实世界多语言基准测试,评估LLMs在自动验证条件证明中的表现,揭示程序验证中的挑战与未来研究方向。

Comments Accepted in ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏