arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 903 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 903 篇

2510.17868 2026-07-16 cs.SE 版本更新 80%

UniCode: Augmenting Evaluation for Code Reasoning

UniCode: 增强代码推理的评估

Xinyue Zheng, Haowei Lin, Shaofei Cai, Yaodong Yang, Zilong Zheng, Yitao Liang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 UniCode通过多维增强和自动化测试生成框架,揭示了大语言模型在代码推理中的性能下降问题,强调模型对捷径的依赖而非真正的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07403 2026-07-07 cs.CV cs.AI cs.CL cs.LG 版本更新 80%

SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

空间思考者:通过密集奖励强化场景图基础的空间推理

Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, Ronald Clark

机构 * University of Oxford(牛津大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对多模态大语言模型空间推理难题,提出SpatialThinker,通过在线强化学习统一场景图生成与视觉推理,构建心理场景图并借助密集奖励推理,贡献包括基于SGG推理、高质量训练数据集及密集奖励设计。

Comments Preprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02444 2026-07-03 cs.DB 版本更新 80%

From Textual Columns to Query Plans: A Unified Relational-Semantic Execution Framework for Hybrid Query Processing

OmniTQA:一种面向半结构化数据的混合查询处理成本感知系统

Nima Shahbazi, Seiji Maekawa, Nikita Bhutani, Estevam Hruschka

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 OmniTQA通过整合LLM语义操作与传统关系运算符,提出了一种成本感知的混合查询处理框架,有效处理结构化与半结构化数据,提升复杂查询和大规模表的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05256 2026-07-03 cs.CV 版本更新 80%

Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum

Wiki-R1: 通过数据和采样课程激励基于知识的多模态推理用于VQA

Shan Ning, Longtian Qiu, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心) Lingang Laboratory(临港实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 提出Wiki-R1框架,通过可控课程数据生成和课程采样策略,结合强化学习激励MLLMs在KB-VQA中的推理能力,在Encyclopedic VQA和InfoSeek上取得新SOTA。

Comments Accepted by ICLR 26, code and weights are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28076 2026-06-18 cs.CL cs.AI cs.LG 版本更新 80%

TopBench: A Benchmark for Implicit Predictive Reasoning in Tabular Question Answering

TopBench:表格问答中隐式预测推理的基准

An-Yang Ji, Jun-Peng Jiang, De-Chuan Zhan, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TopBench基准,包含779个样本和四个子任务,评估大语言模型在表格问答中识别隐式预测意图并进行可靠推理的能力,发现当前模型在意图识别上存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01650 2026-06-17 cs.CL cs.AI cs.LG 版本更新 80%

EngTrace: A Symbolic Benchmark for Verifiable Process Supervision of Engineering Reasoning

EngTrace:工程推理可验证过程监督的符号基准

Ayesha Gull, Muhammad Usman Safder, Rania Elbadry, Fan Zhang, Veselin Stoyanov, Preslav Nakov, Zhuohan Xie

机构 * Namal University(纳马尔大学) MBZUAI(马克斯·普朗克智能人工智能研究所) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出EngTrace符号基准,包含1350个参数化测试用例,通过两阶段可验证评估框架(分层协议+AI仲裁)检验中间推理轨迹与最终答案,揭示数值精度与轨迹保真度的权衡。

Comments 33 pages, includes figures and tables; introduces the EngTrace benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02435 2026-06-16 cs.IR 版本更新 80%

Beyond Chunks and Graphs: Retrieval-Augmented Generation through Triplet-Driven Thinking

超越分块与图:基于三元组驱动的检索增强生成

Shengbo Gong, Xianfeng Tang, Qi He, Carl Yang, Wei jin

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出T$^2$RAG框架,利用三元组知识库和迭代检索,在六数据集上平均性能提升11%,检索成本降低45%。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19228 2026-06-09 cs.CL cs.AI cs.IT cs.LG math.IT 版本更新 80%

Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution

通过分步置信度归因诊断黑盒大语言模型的多步推理失败

Xiaoou Liu, Tiejin Chen, Dengjia Zhang, Yaqing Wang, Lu Cheng, Hua Wei

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于分步置信度归因(SCA)的方法,用于诊断黑盒大语言模型在多步推理中的失败,通过信息瓶颈原理对生成的推理轨迹进行置信度评估,并通过实验验证该方法在数学推理和多跳问答任务中的有效性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02909 2026-08-18 cs.LG cs.AI 版本更新 80%

Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR

延迟、平台期或崩溃:评估系统性验证错误对RLVR的影响

Kazuki Egashira, Mark Vero, Jasper Dekoninck, Florian E. Dorner, Robin Staab, Martin Vechev

专题命中 推理与问题求解 :LLM(abstract_cn,comments);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究探究系统性验证错误对RLVR的影响,发现系统性误报会引发次优平台期或性能崩溃,验证器质量需结合错误模式而非仅样本级错误率评估。

Comments COLM 2026. Code: https://github.com/eth-sri/llm-verifier-noise

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12700 2026-08-19 cs.LG cs.AR cs.DC 版本更新 79%

A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family

面向大语言模型生成的GPU内核的契约级验证器,以及门控线性循环(GDN)族的原生Blackward反向传播算法

Rishi Shah, Rishav Shrestha

机构 * E3A Healthcare(E3A医疗公司)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.LG

AI总结 本文提出契约级GPU内核验证器,发现公开系统接受的2638个机器生成内核中39.5%存在无法修复的错误,还构建了GDN族的原生Blackwell反向传播算法,指出现有内核生成正确性信号被高估。

Comments 20 pages, 3 figures. Also archived at doi:10.5281/zenodo.21563213

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08748 2026-08-19 cs.RO cs.AI 版本更新 79%

Visual Prompting for Robotic Manipulation with Annotation-Guided Pick-and-Place Using ACT

面向机器人操作的视觉提示:采用带标注引导的拾取与放置方法,基于ACT算法

Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

机构 * Embodied AI Research Team(具身人工智能研究团队) National Institute of AIST(国家信息与系统技术研究所)

专题命中 推理与问题求解 :prompting(title,abstract);分类 cs.AI

AI总结 针对便利店机器人拾取放置任务的挑战,提出带标注引导视觉提示的感知-行动流水线,采用ACT算法实现自适应操作,提升了零售环境下的抓取精度与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03988 2026-08-18 cs.AI 版本更新 79%

Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models

想象感知标记增强多模态语言模型的空间推理能力

Mahtab Bigverdi, Linjie Li, Weikai Huang, Yiming Liu, Jaemin Cho, Tuhin Kundu, Chris Dongjoo Kim, Zelun Luo, Jieyu Zhang, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(Allen人工智能研究所) Microsoft(微软) OpenAI(开放人工智能研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 提出想象感知标记(IPT)作为中间感知表征,通过监督学习提升多模态语言模型在不可见视角推理、遮挡路径追踪等空间推理任务上的性能,在三个新构建的数据集上优于文本思维链训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21576 2026-08-18 cs.CL 版本更新 79%

Vision Language Models Cannot Plan, but Can They Formalize?

视觉语言模型(VLMs)无法规划,但它们能进行形式化吗?

Muyu He, Yuxi Zheng, Yuchen Liu, Zijian An, Bill Cai, Jiani Huang, Lifeng Zhou, Feng Liu, Ziyang Li, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本研究提出5种VLM作为形式化器的流水线,评估后发现其表现优于端到端规划生成,较弱VLMs的瓶颈为物体关系视觉grounding,较强模型已克服该限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24396 2026-08-11 cs.AI 版本更新 79%

Understanding and Mitigating Premature Confidence for Better LLM Reasoning

理解并缓解过早自信以提升大语言模型推理能力

Jingchu Gai, Guanning Zeng, Christina Baek, Chen Wu, J. Zico Kolter, Andrej Risteski, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.AI

AI总结 针对大语言模型长思维链中逻辑跳跃和过早自信问题,提出渐进式自信塑造强化学习目标,无需外部标签或奖励模型,通过奖励逐步自信增长并惩罚过早承诺,显著提升推理准确性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10119 2026-08-11 cs.AI 版本更新 79%

Intelligence Foundation Model: A New Perspective to Approach Artificial General Intelligence

智能基础模型:一种新视角来实现通用人工智能

Borui Cai, Yao Zhao

机构 * Hangzhou International Innovation Institute, Beihang University, China(北京航空航天大学杭州国际创新研究院) Victoria University, Melbourne, Australia(墨尔本维多利亚大学)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出智能基础模型,通过模拟生物神经系统的动态过程和神经元输出预测,为实现通用人工智能提供新的视角和方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13502 2026-08-05 cs.CL 版本更新 79%

BOW: Training Language Models to Reason Over Plausible Next Words

BOW:训练语言模型对合理的下一个单词进行推理

Ming Shen, Zhikun Xu, Jacob Dineen, Xiao Ye, Ben Zhou

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 BOW是一种RL框架,通过训练语言模型生成合理下一个单词空间的全面描述,在10个推理基准上表现优于部分基线,BOW-Reg还能提升SharedRef正确率并降低单义崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14686 2026-08-04 cs.CV cs.AI 版本更新 79%

MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model

MVHOI: 通过3D基础模型桥接多视角条件与复杂人-物体交互视频重现

Jinguang Tong, Jinbo Wu, Kaisiyuan Wang, Zhelun Shen, Xuan Huang, Mochu Xiang, Xuesong Li, Yingying Li, Haocheng Feng, Chen Zhao, Hang Zhou, Wei He, Chuong Nguyen, Jingdong Wang, Hongdong Li

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出MVHOI框架,通过3D基础模型结合多视角参考条件,生成复杂人-物体交互视频,提升了长时视频生成的性能。

Comments Project page: https://mvhoi.hirotong.fun

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06828 2026-08-03 cs.CV cs.AI 版本更新 79%

Step-Level Visual Grounding Faithfulness Predicts Out-of-Distribution Generalization in Long-Horizon Vision-Language Models

步级视觉 grounding 信念预测长视界视觉语言模型的分布外泛化

Md Ashikur Rahman, Md Arifur Rahman, Niamul Hassan Samin, Abdullah Ibne Hanif Arean, Juena Ahmed Noshin

机构 * The KOW Company(KOW公司) University of Dhaka(达卡大学) American International University - Bangladesh (AIUB)(孟加拉国美国国际大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 研究发现长视界视觉语言模型中,步级视觉接地信念预测分布外泛化能力,揭示了模型中间推理与视觉状态的一致性对鲁棒性的影响。

Comments Following the initial submission, we conducted additional experiments that materially changed our understanding of the problem. These new results do not support the central claim of the current manuscript. To avoid disseminating conclusions that we no longer consider adequately supported, we are withdrawing this version while we reassess the findings and prepare a substantially revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12711 2026-07-20 cs.AI cs.LO 版本更新 79%

MaxSAT-Based Feedback for Guiding Vision-Language Models in Sudoku

基于最大可满足性的反馈在数独中引导视觉语言模型

Pedro Orvalho, Guillem Alenyà, Felip Manyà

机构 * Artificial Intelligence Research Institute (IIIA), Consejo Superior de Investigaciones Científicas (CSIC)(人工智能研究所(IIIA),西班牙科学研究高级理事会(CSIC)) Institut de Robòtica i Informàtica Industrial (IRI-CSIC-UPC)(工业机器人与信息学研究所(IRI-CSIC-UPC))

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 研究在数独中引导视觉语言模型的问题,提出通过MaxSAT预言机将形式约束推理集成到VLM求解过程的神经符号方法,经实验验证该方法能提高逻辑一致性和解决实例数量,增强视觉语言推理可靠性。

Comments Accepted at the 25th EPIA Conference on Artificial Intelligence, EPIA 2026. 16 pages, 1 figure, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10383 2026-07-20 cs.CV cs.AI cs.RO 版本更新 79%

ABot-N1: Toward a General Visual Language Navigation Foundation Model

ABot-N1:迈向通用视觉语言导航基础模型

Ruiyan Gong, Yingnan Guo, Junjun Hu, Jintao Kong, Xiaoxu Leng, Tianlun Li, Weize Li, Fei Liu, Zhicheng Liu, Jia Lu, Minghua Luo, Chenlin Ming, Yanfen Shen, Jiyue Tao, Zhengbo Wang, Mingyang Yin, Minqi Gu, Zihao Guan, Wei Guo, Guoqing Liu, Huachong Pang, Menglin Yang, Zeqian Ye, Xiaoxiao Geng, Zhining Gu, Honglin Han, Di Jing, Hongyu Pan, Mingchao Sun, Kuan Yang, Jianfang Zhang, Yanghong Chen, Ye He, Wei Mei, Jiahao Shi, Xiangpo Yang, Yanqing Zhu, Yang Cai, Jingjing Ma, Shihui Su, Zixiao Tang, Linbo Zheng, Zedong Chu, Xiaolong Wu, Wenbin Tang, Mu Xu

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 研究旨在构建通用视觉语言导航基础模型,针对当前方法问题,提出ABot-N1,通过慢-快架构解耦认知与控制,利用双视觉语言信号,实现跨场景稳健、可推广且可解释的导航,在城市规模导航等任务中表现出色并开源新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19771 2026-07-08 cs.AI 版本更新 79%

Beyond Reactivity: Measuring Proactive Problem Solving in LLM Agents

超越反应性:衡量大语言模型智能体中的主动解决问题能力

Gil Pasternak, Dheeraj Rajagopal, Julia White, Dhruv Atreja, Matthew Thomas, George Hurn-Maloney, Ash Lewis

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 研究旨在衡量大语言模型智能体的主动解决问题能力。提出PROBE方法,将主动性分解为三个核心能力。应用该方法评估领先模型和框架,发现即使最先进的模型表现也不佳,GPT-5和Claude Opus-4.1最佳端到端性能为40%,突出局限并揭示未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29879 2026-07-01 cs.CV cs.AI 版本更新 79%

LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving

LWDrive: 基于逐层世界模型的视觉-语言模型自动驾驶规划

Chen Yang, Yuhao Wei, Ze Xu, Ziheng Zou, Shuang Liang, Delin Ouyang, Lingfeng Qi, Jie Li, Guofa Li

机构 * Chongqing University(重庆大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 提出LWDrive框架,通过逐层世界模型引导,将VLM输出的粗轨迹逐步细化为几何精确、多视角感知的规划轨迹,在NAVSIM基准上取得92.0分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00869 2026-06-24 cs.CL 版本更新 79%

What's Missing in Vision-Language Models? Probing Their Struggles with Causal Order Reasoning

视觉-语言模型缺少什么?探究它们在因果顺序推理中的困难

Zhaotian Weng, Haoxuan Li, Xin Eric Wang, Kuan-Hao Huang, Jieyu Zhao

机构 * University of Southern California(南加州大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) Texas A&M University(德克萨斯A&M大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 针对VLM在因果推理中的不足,提出VQA-Causal和VCR-Causal基准,发现模型在因果任务上仅略优于随机猜测,归因于训练数据缺乏因果表达,并通过难负例微调改善。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13744 2026-06-23 cs.CV cs.AI 版本更新 79%

Mitigating Cross-Image Information Leakage in Multi-Image Understanding with Large Vision-Language Models

缓解多图像理解中大型视觉语言模型的跨图像信息泄露

Yeji Park, Minyoung Lee, Sanghyuk Chun, Junsuk Choe

机构 * Sogang University(ソガン大学) Princeton University(普林斯顿大学) NAVER AI Lab(NAVER AI实验室)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 针对大型视觉语言模型在多图像输入时性能下降的问题,提出无需训练且架构无关的FOCUS方法,通过随机噪声掩码和噪声参考输入抑制跨图像信息泄露,显著提升多图像和视频理解性能。

Comments Source code is available at https://github.com/yejipark-m/FOCUS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01733 2026-06-16 cs.CV cs.AI 版本更新 79%

GEASS: Gated Evidence-Adaptive Selective Caption Trust for Vision-Language Models

GEASS: 基于证据适应的门控选择性描述信任机制用于视觉-语言模型

Zeshang Li, Shuoyang Zhang

机构 * University of International Relations(国际关系大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出GEASS,一种无需训练的模块,通过门控、加权和证据标准来决定模型在每个查询中消耗多少描述信息,从而提升视觉-语言模型的准确性。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16713 2026-06-12 cs.CV cs.AI 版本更新 79%

GeoWorld-VLM: Geometry from World Models for Vision-Language Models

GeoWorld-VLM:从世界模型中获取几何结构用于视觉-语言模型

Renjie Gu, Kaichen Zhou, Yan Luo, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Kempner Institute for the Study of Natural and Artificial Intelligence(凯普纳自然与人工智能研究 institute) Harvard University(哈佛大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 GeoWorld-VLM通过将冻结的摄像机条件视频世界模型的几何结构转移到视觉-语言模型中,提升空间关系推理能力,实验显示在两个不同架构上均提升了约4%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16651 2026-06-11 cs.CV cs.LG 版本更新 79%

Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations

正确预测,误导性解释:关于视觉-语言模型解释的脆弱性

Narges Babadi, Hadis Karimipour

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 研究探讨了视觉-语言模型中解释热图在对抗条件下是否忠实反映推理过程,提出X-Shift攻击揭示解释与预测行为的脱节,验证了解释机制的脆弱性。

Comments Accepted at the ICML 2026 Workshop on Trustworthy AI for Good (AI4GOOD), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02386 2026-06-10 cs.AI q-bio.QM 版本更新 79%

AgentPLM: Agentic Protein Language Models with Reasoning-Augmented Decoding for Protein Sequence Design

AgentPLM:具有推理增强解码的智能体蛋白质语言模型用于蛋白质序列设计

Sahil Rahman, Maxx Richard Rahman

机构 * Sahil Rahman Maxx Richard Rahman

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 提出AgentPLM,通过推理增强解码和对比智能体策略优化,使预训练蛋白质语言模型能够利用外部生物物理反馈进行在线纠错,在多项蛋白质设计任务上取得最优结果。

Journal ref Workshop on Generative and Agentic AI for Biology, 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03924 2026-08-13 cs.CL cs.AI 版本更新 79%

Uncertainty as a Planning Signal: Multi-Turn Decision Making for Goal-Oriented Conversation

不确定性作为规划信号:面向目标导向对话的多轮决策

Xinyi Ling, Ye Liu, Reza Averly, Xia Ning

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CUP框架,通过结合语言模型与结构化规划,解决目标导向对话中不确定性与信息获取之间的平衡问题,提升对话成功率并减少交互轮次。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21412 2026-08-12 cs.AI cs.CL cs.SE 版本更新 79%

Euclid-MCP: A Model Context Protocol Server for Deterministic Logical Reasoning via Prolog

欧几里得-MCP:一个通过Prolog进行确定性逻辑推理的模型上下文协议服务器

Bartolomeo Bogliolo

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大型语言模型多步逻辑推理不可靠问题,提出开源的欧几里得-MCP服务器,通过引入欧几里得-IR及支持特定循环的工具接口实现确定性逻辑推理,经评估在处理大问题时效果优于LLMs,可作稳定推理基础。

详情

展开后加载摘要…

URL PDF HTML 收藏