arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-04 至 2026-02-04 共收录 126 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 31 篇

2602.01155 2026-02-04 cs.AI cs.SE 79%

Multi-Agent Causal Reasoning System for Error Pattern Rule Automation in Vehicles

多智能体因果推理系统用于车辆中错误模式规则自动化

Hugo Math, Julian Lorenz, Stefan Oelsner, Rainer Lienhart

机构 * BMW Group(宝马集团) Augsburg University(奥格斯堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CAREP通过多智能体系统自动发现车辆错误模式规则,提供透明因果解释,提升故障诊断的自动化与可解释性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16964 2026-02-04 cs.CV cs.CL 79%

MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning

MedFrameQA: 一个多图像医学视觉问答基准用于临床推理

Suhao Yu, Haojin Wang, Juncheng Wu, Luyang Luo, Jingshen Wang, Cihang Xie, Pranav Rajpurkar, Carl Yang, Yang Yang, Kang Wang, Yannan Yu, Yuyin Zhou

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UC Santa Cruz(加州大学圣克鲁兹分校) Harvard University(哈佛大学) UC Berkeley(加州大学伯克利分校) Emory University(埃默里大学) UC San Francisco(旧金山加州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MedFrameQA是一个多图像医学视觉问答基准,旨在评估多图像医学推理能力,揭示现有模型在处理复杂医学叙述时的不足。

Comments 27 pages, 15 Figures Benchmark data: https://huggingface.co/datasets/SuhaoYu1020/MedFrameQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03665 2026-02-04 cs.CV cs.HC 78%

MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment

MM-SCALE: 基于标量判断和列表对齐的 grounded 多模态道德推理

Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim

机构 * Seoul National University(首尔国立大学) Carnegie Mellon University(卡内基梅隆大学) University of Florida(佛罗里达大学) Epic Games

专题命中 推理评测 :reasoning(title,abstract)

AI总结 MM-SCALE通过5点标量评分和显式模态接地,提升多模态模型在道德推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02444 2026-02-04 cs.IR cs.CV 78%

RANKVIDEO: Reasoning Reranking for Text-to-Video Retrieval

RANKVIDEO: 文本到视频检索中的推理重排序

Tyler Skow, Alexander Martin, Benjamin Van Durme, Rama Chellappa, Reno Kriz

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人机语言技术卓越中心)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 RANKVIDEO通过基于视频内容的推理机制,提升了文本到视频检索的重排序性能,实验显示在nDCG@10上平均提升31%,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18533 2026-02-04 cs.CV cs.CL cs.CR 77%

Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models

重新审视视觉语言模型安全微调中的瓶颈

Yi Ding, Lijun Li, Bing Cao, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Purdue University(普渡大学) Tianjin University(天津大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出多图像安全数据集,通过增强视觉推理能力,提升模型在安全关键任务中的性能与通用能力。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03285 2026-02-04 cs.AI 70%

MeetBench-XL: Calibrated Multi-Dimensional Evaluation and Learned Dual-Policy Agents for Real-Time Meetings

MeetBench-XL: 一种经过校准的多维评估和学习双策略代理用于实时会议

Yuelin Hu, Jun Xu, Bingcong Lu, Zhengxue Cheng, Hongwei Hu, Ronghua Wu, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(法国巴黎-罗克琴特研究所) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究实验室)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 MeetBench-XL通过多维评估和学习双策略代理提升实时会议AI助手的性能与效率

Comments accepted by AAAI2026 ws

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03181 2026-02-04 cs.SE 67%

Synthesizing File-Level Data for Unit Test Generation with Chain-of-Thoughts via Self-Debugging

通过自我调试合成文件级数据用于单元测试生成的链式思考

Ziyue Hua, Tianyu Chen, Yeyun Gong, Shuai Lu, Peng Cheng, Qinglin Zhu, Yibo He, Yingjie Fu, Wenpin Jiao, Wei Yang, Tao Xie

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

AI总结 通过自我调试合成文件级数据用于单元测试生成,提升测试生成质量与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00508 2026-02-04 cs.CV 67%

DuoGen: Towards General Purpose Interleaved Multimodal Generation

DuoGen:迈向通用的交错多模态生成

Min Shi, Xiaohui Zeng, Jiannan Huang, Yin Cui, Francesco Ferroni, Jialuo Li, Shubham Pachori, Zhaoshuo Li, Yogesh Balaji, Haoxiang Wang, Tsung-Yi Lin, Xiao Fu, Yue Zhao, Chieh-Yun Chen, Ming-Yu Liu, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) NVIDIA research.nvidia.com/labs/dir/duogen(NVIDIA 研究所)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 DuoGen通过系统性地解决数据整理、架构设计和评估问题,实现了通用的交错多模态生成,提升了文本质量、图像保真度和图像-上下文对齐性能。

Comments Technical Report. Project Page: https://research.nvidia.com/labs/dir/duogen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21602 2026-02-04 cs.RO 67%

AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation

AIR-VLA:面向空中操作的视觉-语言-动作系统

Jianli Sun, Bin Tian, Qiyao Zhang, Chengxiang Li, Zihan Song, Zhiyong Cui, Yisheng Lv, Yonglin Tian

机构 * The Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Information and Intelligent Engineering, University of Sanya(三亚大学信息与智能工程学院) School of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与车辆工程学院) State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 AIR-VLA提出首个针对空中操作的视觉-语言-动作系统,通过构建仿真环境和多模态数据集,评估主流模型并揭示其在无人机移动、机械臂控制和高层规划中的能力和限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03633 2026-02-04 cs.CL cs.AI cs.DB 62%

BIRDTurk: Adaptation of the BIRD Text-to-SQL Dataset to Turkish

BIRDTurk: BIRD文本到SQL数据集对土耳其语的适应

Burak Aktaş, Mehmet Can Baytekin, Süha Kağan Köse, Ömer İlbilgi, Elif Özge Yılmaz, Çağrı Toraman, Bilge Kaan Görür

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 BIRDTurk是首个将BIRD文本到SQL基准适应到土耳其语的数据集,通过受控翻译流程保持SQL逻辑结构,评估了代理推理和监督微调在土耳其语中的表现,揭示了语言差异对性能的影响。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07020 2026-02-04 cs.CL cs.AI 62%

TurkBench: A Benchmark for Evaluating Turkish Large Language Models

TurkBench:评估土耳其大型语言模型的基准测试

Çağrı Toraman, Ahmet Kaan Sever, Ayse Aysu Cengiz, Elif Ecem Arslan, Görkem Sevinç, Mete Mert Birdal, Yusuf Faruk Güldemir, Ali Buğra Kanburoğlu, Sezen Felekoğlu, Osman Gürlek, Sarp Kantar, Birsen Şahin Kütük, Büşra Tufan, Elif Genç, Serkan Coşkun, Gupse Ekin Demir, Muhammed Emin Arayıcı, Olgun Dursun, Onur Gungor, Susan Üsküdarlı, Abdullah Topraksoy, Esra Darıcı

机构 * Computer Sci. Dpt., Bilkent Uni.(计算机科学系,比尔肯特大学) Mathematics Dpt., Middle East Technical University(数学系,中东部技术大学) Turkcell AI(Turkcell人工智能) Sociology Dpt., Hacettepe University(社会学系,哈恰塔尔佩大学) Computer Engineering Dpt., Bogazici University(计算机工程系,博资基大学) Linguistics Dpt., Istanbul University(语言学系,伊斯坦布尔大学) Turkish Lang. Dpt., Middle East Technical University(土耳其语言系,中东部技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TurkBench是一个用于评估土耳其大型语言模型能力的综合基准测试,包含21个子任务和6大类别,旨在帮助研究人员改进模型性能。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03709 2026-02-04 cs.CL 57%

No Shortcuts to Culture: Indonesian Multi-hop Question Answering for Complex Cultural Understanding

没有捷径的文化:印尼多跳问答用于复杂文化理解

Vynska Amalia Permadi, Xingwei Tan, Nafise Sadat Moosavi, Nikos Aletras

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ID-MoCQA是一个基于印尼传统的多跳问答数据集,旨在评估大型语言模型的文化理解能力,揭示模型在文化推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03587 2026-02-04 cs.CL 57%

CL-bench: A Benchmark for Context Learning

CL-bench: 一个用于上下文学习的基准测试

Shihan Dou, Ming Zhang, Zhangyue Yin, Chenhao Huang, Yujiong Shen, Junzhe Wang, Jiayi Chen, Yuchen Ni, Junjie Ye, Cheng Zhang, Huaibing Xie, Jianglu Hu, Shaolei Wang, Weichao Wang, Yanling Xiao, Yiting Liu, Zenan Xu, Zhen Guo, Pluto Zhou, Tao Gui, Zuxuan Wu, Xipeng Qiu, Qi Zhang, Xuanjing Huang, Yu-Gang Jiang, Di Wang, Shunyu Yao

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CL-bench是一个用于评估上下文学习能力的基准测试,通过复杂任务和上下文设计,揭示当前语言模型在真实任务中的学习瓶颈。

Comments 78 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21551 2026-02-04 cs.LG 57%

Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test

在LLM预训练中“Grokking”?无需测试即可监控记忆到泛化的过程

Ziyue Li, Chenrui Fan, Tianyi Zhou

机构 * Department of Computer Science, University of Maryland, College Park(计算机科学系,马里兰大学,学院公园)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文研究了LLM预训练中“Grokking”现象,通过分析训练数据路径的动态变化,提出两种新度量标准以监控模型泛化能力,无需额外成本。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03134 2026-02-04 cs.CV cs.AI 57%

SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass

SwiftVLM: 通过跨层令牌绕过实现高效的视觉-语言模型推理

Chen Qian, Xinran Yu, Danyang Li, Guoxuan Chi, Zheng Yang, Qiang Ma, Xin Miao

机构 * Tsinghua University, Beijing, China(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SwiftVLM通过跨层令牌绕过方法,在视觉-语言模型中实现高效的推理,优于现有修剪策略,提升准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03128 2026-02-04 cs.AI 57%

Understanding Multi-Agent LLM Frameworks: A Unified Benchmark and Experimental Analysis

理解多智能体大语言模型框架:一个统一的基准测试和实验分析

Abdelghny Orogat, Ana Rostam, Essam Mansour

机构 * Concordia University(康科迪亚大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出MAFBench统一评估套件,系统比较多智能体LLM框架,揭示架构设计对性能的显著影响。

Comments 25 pages, 9 figures and 13 tables; introduces MAFBench unified multi-agent evaluation suite

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02601 2026-02-04 cs.SI cs.AI 57%

CaST: Causal Discovery via Spatio-Temporal Graphs in Disaster Tweets

基于灾难推文的时空图因果发现:CaST

Hieu Duong, Eugene Levin, Todd Gary, Long Nguyen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CaST通过整合语义、时空信息,利用大规模语言模型构建事件图,实现灾难推文中更稳健和可解释的因果发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02537 2026-02-04 cs.CV cs.LG 57%

WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models

WorldVQA:评估多模态大语言模型的原子视觉世界知识

Runjie Zhou, Youbo Shao, Haoyu Lu, Bowei Xing, Tongtong Bai, Yujie Chen, Jie Zhao, Lin Sui, Haotian Yao, Zijia Zhao, Hao Yang, Haoning Wu, Zaida Zhou, Jinguo Zhu, Zhiqi Huang, Yiping Bao, Yangyang Liu, Y. Charles, Xinyu Zhou

机构 * Moonshot AI

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 WorldVQA通过评估多模态大语言模型的原子视觉知识,建立衡量其事实性和百科全书广度的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02196 2026-02-04 cs.AI 57%

TIDE: Trajectory-based Diagnostic Evaluation of Test-Time Improvement in LLM Agents

基于轨迹的测试时改进诊断评估:LLM代理中的测试时改进

Hang Yan, Xinyu Che, Fangzhi Xu, Qiushi Sun, Zichen Ding, Kanzhi Cheng, Jian Zhang, Tao Qin, Jun Liu, Qika Lin

机构 * Xi’an Jiaotong University(西安交通大学) The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TIDE提出了一种评估框架,用于诊断LLM代理在测试时改进中的性能瓶颈,通过分析任务完成的时间动态、递归循环行为和记忆负担,优化代理与环境的交互。

Comments 29pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00748 2026-02-04 cs.DC cs.AI cs.AR 57%

HyperOffload: Graph-Driven Hierarchical Memory Management for Large Language Models on SuperNode Architectures

HyperOffload: 图驱动的分层内存管理用于超节点架构上的大型语言模型

Fangxin Liu, Qinghua Zhang, Hanjing Shen, Zhibo Liang, Li Jiang, Haibing Guan, Chong Bao, Xuefeng Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 HyperOffload通过图驱动的编译器方法优化超节点架构上的LLM内存管理,减少峰值内存使用并提升计算效率。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11361 2026-02-04 cs.AI 57%

MAPGD: Multi-Agent Prompt Gradient Descent for Collaborative Prompt Optimization

MAPGD:多智能体提示梯度下降用于协作提示优化

Yichen Han, Yuhang Han, Siteng Huang, Guanyu Liu, Zhengpeng Zhou, Bojun Liu, Yujia Zhang, Isaac N Shi, Lewei He, Tianyu Shi

机构 * South China Normal University(华南师范大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Macau(澳门大学) University of Sydney(悉尼大学) Silicon Sapiens LLC University of Alberta(阿尔伯塔大学) University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MAPGD通过多智能体协作机制提升提示优化的鲁棒性和效率,结合梯度融合与动态加权实现高效且可解释的优化方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23155 2026-02-04 cs.RO 50%

LAGEA: Language Guided Embodied Agents for Robotic Manipulation

LAGEA:基于语言引导的机器人操作代理

Abdul Monaf Chowdhury, Akm Moshiur Rahman Mazumder, Rabeya Akter, Safaeid Hossain Arib

机构 * Department of Robotics Mechatronics Engineering, University of Dhaka, Bangladesh Center for Computational \& Data Sciences, Independent University, Bangladesh

专题命中 推理评测 :reasoning(abstract)

AI总结 LAGEA通过语言引导具身代理学习,提升机器人操作任务的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03056 2026-02-04 cs.IR 50%

ALPBench: A Benchmark for Attribution-level Long-term Personal Behavior Understanding

ALPBench:一种用于属性级长期个人行为理解的基准测试

Lu Ren, Junda She, Xinchen Luo, Tao Wang, Xin Ye, Xu Zhang, Muxuan Wang, Xiao Yang, Chenguang Wang, Fei Xie, Yiwei Zhou, Danjun Wu, Guodong Zhang, Yifei Hu, Guoying Zheng, Shujie Yang, Xingmei Wang, Shiyao Wang, Yukun Zhou, Fan Yang, Size Li, Kuo Cai, Qiang Luo, Ruiming Tang, Han Li, Kun Gai

专题命中 推理评测 :reasoning(abstract)

AI总结 ALPBench是一种用于属性级长期个人行为理解的基准测试,通过预测用户感兴趣的属性组合,实现对个性化推荐的细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02964 2026-02-04 cs.SE 50%

Testing Framework Migration with Large Language Models

利用大语言模型进行测试框架迁移

Altino Alves, João Eduardo Montandon, Andre Hora

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本文研究了大语言模型在自动化unittest到Pytest测试框架迁移中的能力,发现其在迁移过程中存在成功与失败并存的情况,且不同模型在迁移策略上表现各异。

Comments Accepted for publication at AST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 12 篇

2504.02546 2026-02-04 cs.LG cs.AI 81%

GPG: A Simple and Strong Reinforcement Learning Baseline for Model Reasoning

GPG:一种简单而强大的用于模型推理的强化学习基线

Xiangxiang Chu, Hailang Huang, Xiao Zhang, Fei Wei, Yong Wang

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 GPG提出了一种简化且高效的强化学习方法,通过直接优化原始目标并消除冗余组件,实现了在多种任务中优于传统方法的性能。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03414 2026-02-04 cs.CV cs.AI 79%

Socratic-Geo: Synthetic Data Generation and Geometric Reasoning via Multi-Agent Interaction

Socratic-Geo:通过多智能体交互实现合成数据生成与几何推理

Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang

机构 * AI DATA, Alibaba Group Holding Limited(阿里数据,阿里巴巴集团控股有限公司) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Shanghai University of Finance(上海财经大学) Wuhan University(武汉大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Socratic-Geo通过多智能体交互实现合成数据生成与几何推理,利用教师代理和求解代理动态耦合数据合成与模型学习,提升图像生成和推理能力。

Comments 18pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02635 2026-02-04 cs.CL 79%

Graph-Augmented Reasoning with Large Language Models for Tobacco Pest and Disease Management

基于图增强推理的烟草害虫和疾病管理

Siyu Li, Chenwei Song, Qi Zhou, Wan Zhou, Xinyi Liu

机构 * School of Information Science and Engineering(信息科学与工程学院) Chongqing Jiaotong University(重庆交通大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种基于图增强推理的框架,通过整合领域知识图谱,提升烟草害虫和疾病管理的推理能力和推荐准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00197 2026-02-04 q-bio.QM cs.AI cs.CL 73%

Rank-and-Reason: Multi-Agent Collaboration Accelerates Zero-Shot Protein Mutation Prediction

Rank-and-Reason: 多智能体协作加速零样本蛋白质突变预测

Yang Tan, Yuanxi Yu, Can Wu, Bozitao Zhong, Mingchen Li, Guisheng Fan, Jiankang Zhu, Yafeng Liang, Nanqing Dong, Liang Hong

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science(南方大学(科学)) East China University of Science and Technology(东中国科学与技术大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 Rank-and-Reason通过多智能体协作提升零样本蛋白质突变预测的准确性与效率,显著提高湿实验验证的成功率。

Comments 22 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07891 2026-02-04 cs.LG cs.AI cs.CL 67%

KVzap: Fast, Adaptive, and Faithful KV Cache Pruning

KVzap:快速、自适应和忠实的KV缓存修剪

Simon Jegou, Maximilian Jeblick

机构 * NVIDIA(英伟达)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KVzap通过快速且自适应的KV缓存修剪方法,在保持高精度的同时实现显著的缓存压缩,适用于长上下文和推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02686 2026-02-04 cs.CL cs.AI cs.CR cs.LG 67%

Monotonicity as an Architectural Bias for Robust Language Models

单调性作为提升语言模型鲁棒性的架构偏倚

Patrick Cooper, Alireza Nadali, Ashutosh Trivedi, Alvaro Velasquez

机构 * Department of Computer Science, University of Colorado Boulder, Boulder, CO, USA(计算机科学系,科罗拉多大学波尔德分校,波尔德,科罗拉多州,美国)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过在Transformer模型中引入单调性约束,提升语言模型对对抗攻击的鲁棒性,同时保持预训练性能。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏