arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-16 至 2026-01-16 共收录 69 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 11 篇

2601.10712 2026-01-16 cs.CL cs.AI 81%

MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching

MatchTIR: 通过双图匹配实现工具集成推理的细粒度监督

Changle Qu, Sunhao Dai, Hengyi Cai, Jun Xu, Shuaiqiang Wang, Dawei Yin

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Baidu Inc.(百度公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MatchTIR通过双图匹配实现细粒度监督,提升工具集成推理在长周期多轮任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10109 2026-01-16 cs.CL 79%

Skill-Aware Data Selection and Fine-Tuning for Data-Efficient Reasoning Distillation

具备技能的数据选择与微调用于数据高效的推理蒸馏

Lechen Zhang, Yunxiang Zhang, Wei Hu, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于技能的蒸馏框架,通过数据选择和微调提升推理效率,实验证明在数学推理基准上优于随机微调基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10228 2026-01-16 cs.CV cs.MM eess.IV 75%

Optimizing Multimodal LLMs for Egocentric Video Understanding: A Solution for the HD-EPIC VQA Challenge

优化多模态大语言模型以实现视角视频理解:HD-EPIC VQA挑战的解决方案

Sicheng Yang, Yukai Huang, Shitong Sun, Weitong Cai, Jiankang Deng, Jifei Song, Zhensong Zhang

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出一种优化多模态大语言模型的方法,通过预处理、微调和时间链式思考提示,在HD-EPIC VQA挑战中实现了41.6%的准确率。

Comments 4 pages, 1 figure, CVPR 2025 EgoVis Workshop, 2nd Place in HD-EPIC Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10581 2026-01-16 cs.AI cs.IR 74%

From Single to Multi-Agent Reasoning: Advancing GeneGPT for Genomics QA

从单 agent 到多 agent 推理:提升 GeneGPT 的基因组 QA 能力

Kimia Abedini, Farzad Shami, Gianmaria Silvello

机构 * University of Padua, Italy(帕多瓦大学,意大利) Aalto University, Finland(阿alto大学,芬兰)

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

AI总结 GenomAgent通过多 agent框架提升基因组 QA 能力,实现对复杂基因组查询的高效处理,并在多个任务中超越现有系统。

Comments Accepted paper by the 48th European Conference on Information Retrieval (ECIR'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10318 2026-01-16 cs.CL 70%

Boundary-Aware NL2SQL: Integrating Reliability through Hybrid Reward and Data Synthesis

边界感知的NL2SQL:通过混合奖励和数据合成集成可靠性

Songsong Tian, Kongsheng Zhuo, Zhendong Wang, Rong Shen, Shengtao Zhang, Yong Wu

机构 * Li Auto Inc.(Li汽车公司) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 BAR-SQL通过混合奖励和数据合成方法,提升NL2SQL在生成准确性和边界感知回避能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08763 2026-01-16 cs.LG cs.CL 62%

Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs

奖励罕见性:面向LLM创造性问题解决的唯一性感知强化学习

Zhiyuan Hu, Yucheng Wang, Yufei He, Jiaying Wu, Yilun Zhao, See-Kiong Ng, Cynthia Breazeal, Anh Tuan Luu, Hae Won Park, Bryan Hooi

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出唯一性感知强化学习方法,通过奖励罕见的高级策略提升LLM在复杂推理任务中的多样性与性能。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09714 2026-01-16 cs.CL cs.AI 62%

Evaluating Novelty in AI-Generated Research Plans Using Multi-Workflow LLM Pipelines

利用多工作流LLM管道评估AI生成的研究计划新颖性

Devesh Saraogi, Rohit Singhee, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学学院,皮兰迪)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过多工作流LLM管道评估AI生成研究计划的新颖性,发现递归分解和长上下文工作流在新颖性和可行性方面表现更优。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10167 2026-01-16 cs.CL 57%

Credit C-GPT: A Domain-Specialized Large Language Model for Conversational Understanding in Vietnamese Debt Collection

信用C-GPT:一种面向越南债务催收的领域专用大语言模型

Nhung Nguyen Thi Hong, Cuong Nguyen Dang, Tri Le Ngoc

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 Credit C-GPT是一种针对越南债务催收场景优化的领域专用大语言模型,通过整合多任务对话智能,提升对话理解、情感识别和意图检测等能力,为企业呼叫中心提供实时帮助和分析解决方案。

Comments 8 pages, 0 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10088 2026-01-16 cs.AI 57%

State of AI: An Empirical 100 Trillion Token Study with OpenRouter

AI 状态:一项具有 OpenRouter 的 100 万亿 token 实证研究

Malika Aubakirova, Alex Atallah, Chris Clark, Justin Summerville, Anjney Midha

机构 * OpenRouter

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过分析 100 万亿 token 的真实世界 LLM 交互,揭示了 LLM 在实际应用中的复杂使用模式,包括开放式权重模型的普及、创意角色扮演的流行以及代理推理的兴起。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10551 2026-01-16 cs.CV 50%

Unleashing the Capabilities of Large Vision-Language Models for Intelligent Perception of Roadside Infrastructure

释放大型视觉-语言模型的能力以实现道路基础设施的智能感知

Luxuan Fu, Chong Liu, Bisheng Yang, Zhen Dong

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS)(信息工程测绘遥感国家重点实验室) Wuhan University(武汉大学) Hubei Luojia Laboratory(湖北珞珈实验室)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出一种领域适应框架,通过数据高效微调和知识引导推理,提升大型视觉语言模型在城市道路基础设施感知中的性能和专业合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 18 篇

2601.10165 2026-01-16 cs.CV 85%

Advancing Adaptive Multi-Stage Video Anomaly Reasoning: A Benchmark Dataset and Method

推动自适应多阶段视频异常推理:一个基准数据集和方法

Chao Huang, Benfeng Wang, Wei Wang, Jie Wen, Li Shen, Wenqi Ren, Yong Xu, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学计算机科学与技术学院(深圳校区)) Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology(哈尔滨工业大学深圳视觉目标检测与识别重点实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出视频异常推理任务及相应数据集,通过结构化思维链和自适应策略优化,提升多阶段视频异常推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10455 2026-01-16 cs.CL cs.RO 83%

SurgGoal: Rethinking Surgical Planning Evaluation via Goal-Satisfiability

SurgGoal: 重新思考手术计划评估 via 目标满足性

Ruochen Li, Kun Yuan, Yufei Xia, Yue Zhou, Qingyu Lu, Weihang Li, Youxiang Zhu, Nassir Navab

机构 * Technical University of Munich, Germany(慕尼黑技术大学) University of Strasbourg, France(斯特拉斯堡大学) University of Glasgow, United Kingdom(格拉斯哥大学) Nanyang Technological University, Singapore(南洋理工大学) University of Massachusetts Boston, USA(马萨诸塞大学波士顿分校)

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 SurgGoal通过目标满足性度量重新评估手术计划,揭示视频大语言模型在安全关键环境中的性能问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19126 2026-01-16 cs.CL 83%

AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards

AWPO: 通过适应性整合推理奖励增强大语言模型的工具使用

Zihan Lin, Xiaohan Wang, Hexiong Yang, Jiajun Chai, Jie Cao, Guojun Yin, Wei Lin, Ran He

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 AWPO通过适应性整合推理奖励提升大语言模型的工具使用性能,实现多轮场景中的卓越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09709 2026-01-16 cs.LG cs.CL cs.CY 81%

Social Determinants of Health Prediction for ICD-9 Code with Reasoning Models

基于推理模型的ICD-9代码社会决定因素预测

Sharim Khan, Paul Landes, Adam Cross, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Illinois Chicago Peoria(伊利诺伊大学芝加哥分校皮奥里亚分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出利用推理模型和传统大语言模型,在MIMIC-III数据集上对医院入院的多标签社会决定因素ICD-9代码进行分类,实现了89%的F1分数,并发现139次入院中缺失的SDoH代码。

Comments Published as part of Machine Learning for Health (ML4H) 2025 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02064 2026-01-16 cs.CV 78%

RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video

RTV-Bench: 通过实时视频对多模态大语言模型的连续感知、理解和推理进行基准测试

Shuhang Xun, Sicheng Tao, Jungang Li, Yibo Shi, Zhixin Lin, Zhanhui Zhu, Yibo Yan, Hanqian Li, Linghao Zhang, Shikang Wang, Yixin Liu, Hanbo Zhang, Ying Ma, Xuming Hu

机构 * HIT(哈尔滨工业大学) HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) XJTU(西安交通大学) SDU(山东大学) CityU(城市大学) HUST(华中科技大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 RTV-Bench通过实时视频对多模态大语言模型的连续感知、理解和推理能力进行细粒度基准测试,揭示了实时模型在长时段视频处理中的性能优势与局限。

Comments Accepted by NeurIPS 2025 Datasets and Benchmarks Track;

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02737 2026-01-16 cs.CV 75%

Unveiling and Bridging the Functional Perception Gap in MLLMs: Atomic Visual Alignment and Hierarchical Evaluation via PET-Bench

揭示和弥合MLLMs中的功能感知差距:通过PET-Bench实现原子视觉对齐和分层评估

Zanting Ye, Xiaolong Niu, Xuanbin Wu, Xu Han, Shengyuan Liu, Jing Hao, Zhihao Peng, Hao Sun, Jieqin Lv, Fanghu Wang, Yanchao Huang, Hubing Wu, Yixuan Yuan, Habib Zaidi, Arman Rahmim, Yefeng Zheng, Lijun Lu

机构 * School of Biomedical Engineering, Southern Medical University(生物医学工程学院,南方医科大学) School of Biomedical Engineering, Shanghai Jiaotong University(生物医学工程学院,上海交通大学) Department of Electronic Engineering, Chinese University of Hong Kong(电子工程系,中国香港大学) Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) Department of Nuclear Medicine, The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(核医学科,广州中医药大学第二附属医院) PET Center, Department of Nuclear Medicine, Guangdong Provincial People’s Hospital, Southern Medical University(PET中心,核医学科,广东省人民医院,南方医科大学) Department of Nuclear Medicine, Nanfang Hospital, Southern Medical University(核医学科,南芳医院,南方医科大学) Division of Nuclear Medicine and Molecular Imaging, Geneva University Hospitals(核医学与分子影像学部,日内瓦大学医院) Departments of Radiology, Physics, and Biomedical Engineering, The University of British Columbia(放射学、物理和生物医学工程系,不列颠哥伦比亚大学) Medical Artificial Intelligence Laboratory, Westlake University(医学人工智能实验室,西湖大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出AVA方法,通过原子视觉对齐解决MLLMs在功能成像中的感知差距,提升诊断准确性14.83%。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05467 2026-01-16 cs.SE cs.AI 70%

STELP: Secure Transpilation and Execution of LLM-Generated Programs

STELP: 保障LLM生成程序的编译与执行

Swapnil Shinde, Sahil Wadhwa, Andy Luo, Akshay Gupta, Mohammad Shahed Sorower

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 STELP通过安全编译和执行LLM生成的代码,解决生产环境中的安全性和可靠性问题,提升代码执行的安全性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20323 2026-01-16 cs.CL cs.AI cs.LG 67%

PMOA-TTS: Introducing the PubMed Open Access Textual Times Series Corpus

PMOA-TTS:引入PubMed开放获取文本时间序列语料库

Shahriar Noroozizadeh, Sayantan Kumar, George H. Chen, Jeremy C. Weiss

机构 * Machine Learning Department, School of Computer Science(计算机科学系机器学习部门) Heinz College of Information Systems and Public Policy(信息系统与公共政策学院) National Library of Medicine(国家医学图书馆)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PMOA-TTS通过大规模语言模型管道构建,为时间序列分析提供结构化文本时间线,支持时间推理、生存建模和事件预测研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09733 2026-01-16 cs.CL cs.AI 62%

Closing the Data Loop: Using OpenDataArena to Engineer Superior Training Datasets

闭合数据循环:利用OpenDataArena工程更优质的训练数据集

Xin Gao, Xiaoyang Wang, Yun Zhu, Mengzhang Cai, Conghui He, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab, OpenDataArena(上海人工智能实验室、OpenDataLab、OpenDataArena)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用OpenDataArena构建闭合循环数据集,通过ODA-Math-460k和ODA-Mixture数据集展示其在数学推理和多领域指令任务上的卓越性能。

Comments Superior ODA-Math, ODA-Mixture Datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10660 2026-01-16 cs.CL 57%

Detecting Winning Arguments with Large Language Models and Persuasion Strategies

利用大型语言模型和说服策略检测获胜论点

Tiziano Labruna, Arkadiusz Modzelewski, Giorgio Satta, Giovanni Da San Martino

机构 * University of Padua(帕多瓦大学) Polish-Japanese Academy of Information Technology(波兰-日本信息科技学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文利用大型语言模型和说服策略分析论证文本,通过多策略评分方法提升说服力预测,并公开发布主题注释数据集以促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10156 2026-01-16 cs.CL 57%

ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback

ToolSafe: 通过主动的步骤级防护和反馈提升基于LLM的代理的工具调用安全性

Yutao Mou, Zhangchi Xue, Lijun Li, Peiyang Liu, Shikun Zhang, Wei Ye, Jing Shao

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ToolSafe通过构建TS-Bench和TS-Guard模型,结合TS-Flow框架,有效减少LLM代理的有害工具调用并提升任务完成率。

Comments Work in Progress. Code available: https://github.com/MurrayTom/ToolSafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10020 2026-01-16 cs.CL 57%

EHRNavigator: A Multi-Agent System for Patient-Level Clinical Question Answering over Heterogeneous Electronic Health Records

EHRNavigator: 一种用于异构电子健康记录上患者级临床问答的多智能体系统

Lingfei Qian, Mauro Giuffre, Yan Wang, Huan He, Qianqian Xie, Xuguang Ai, Xeuqing Peng, Fan Ma, Ruey-Ling Weng, Donald Wright, Adan Wang, Qingyu Chen, Vipina K. Keloth, Hua Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 EHRNavigator通过多智能体系统在异构电子健康记录上实现患者级临床问答,展示出高准确率和高效响应,有效连接基准评估与临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10010 2026-01-16 cs.CV cs.AI 57%

VERHallu: Evaluating and Mitigating Event Relation Hallucination in Video Large Language Models

VERHallu: 评估和缓解视频大语言模型中的事件关系幻觉

Zefan Zhang, Kehua Zhu, Shijie Jiang, Hongyuan Lu, Shengkai Sun, Tian Bai

机构 * College of Computer Science and Technology, Key Laboratory of Symbolic Computation and Knowledge Engineering, Ministry of Education, Jilin University(吉林大学计算机科学与技术学院,符号计算与知识工程重点实验室,教育部,吉林大学) College of Software, Jilin University(吉林大学软件学院) Facemind Group(FaceMind集团) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VERHallu基准,用于评估和缓解视频大语言模型中的事件关系幻觉,通过关键帧传播策略提升多事件理解能力。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09972 2026-01-16 cs.AI 57%

Chinese Labor Law Large Language Model Benchmark

中国劳动法大语言模型基准

Zixun Lan, Maochun Xu, Yifan Ren, Rui Wu, Jianghui Zhou, Xueyang Cheng, Jianan Ding Ding, Xinheng Wang, Mingmin Chi, Fei Ma

机构 * Department of Mechatronics and Robotics, Xi’an Jiaotong–Liverpool University(机械与机器人系,西安交通大学利物浦大学) Department of Applied Mathematics, Xi’an Jiaotong–Liverpool University(应用数学系,西安交通大学利物浦大学) Hansheng Lawyers Building(翰盛律师事务所) Suzhou Gewu Digital Technology Co., Ltd.(苏州葛武数字技术有限公司) Kenneth Wang School of Law, Soochow University(肯尼斯·王法学院,苏州大学) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LabourLawLLM和LabourLawBench,专门针对中国劳动法任务,通过精确的法律知识和复杂推理提升法律AI的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09713 2026-01-16 cs.CL 57%

LLM-Driven Preference Data Synthesis for Proactive Prediction of the Next User Utterance in Human-Machine Dialogue

基于大语言模型的偏好数据合成用于人机对话中下一用户话语的前瞻性预测

Jinqiang Wang, Huansheng Ning, Jianguo Ding, Tao Zhu, Liming Chen, Chris Nugent

机构 * School of Computer & Communication Engineering, University of Science and Technology Beijing(计算机与通信工程学院,北京科技大学) Department of Computer Science, Blekinge institute of Technology(计算机科学系,布莱金厄理工大学) School of Computer Science, University of South China(计算机科学学院,南方大学) School of Computer Science and Technology, Dalian University of Technology(计算机科学与技术学院,大连理工大学) School of Computing, Ulster University(计算机科学学院,乌斯特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ProUtt通过意图树建模和偏好数据合成,提升人机对话中下一次用户发言的预测精度。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18691 2026-01-16 cs.CL 57%

Investigating LLM Capabilities on Long Context Comprehension for Medical Question Answering

探究大语言模型在医疗问答中的长上下文理解能力

Feras AlMannaa, Talia Tseriotou, Jenny Chim, Maria Liakata

机构 * Istanbul Aydın University(伊斯坦布尔阿迪兰大学) Queen Mary University of London(伦敦女王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究探讨大语言模型在医疗问答中处理长上下文任务的能力,分析了模型大小、记忆问题及RAG方法的效果,揭示了其在不同任务中的优势与限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16821 2026-01-16 cs.NI cs.LG eess.SP 57%

LLM-Based Emulation of the Radio Resource Control Layer: Towards AI-Native RAN Protocols

基于大语言模型的无线资源控制层仿真:迈向AI原生的无线接入网络协议

Ziming Liu, Bryan Liu, Alvaro Valcarce, Xiaoli Chu

机构 * School of Electrical and Electronic Engineering, The University of Sheffield(电子与电气工程学院,谢菲尔德大学) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于大语言模型的RRC层仿真方法,通过参数高效适应和模式受限提示,实现高精度协议仿真,展示了AI原生RAN协议的可行性。

Comments This work has been submitted to the IEEE for possible publication. Focuses on applying LLMs to 5G RRC protocol generation; primary: cs.NI; cross-list: eess.SP, cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10592 2026-01-16 cs.CV 50%

Action100M: A Large-scale Video Action Dataset

Action100M:一个大规模视频动作数据集

Delong Chen, Tejaswi Kasarla, Yejin Bang, Mustafa Shukor, Willy Chung, Jade Yu, Allen Bolourchi, Theo Moutakanni, Pascale Fung

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 Action100M通过自动化流程生成大规模视频动作数据集,用于提升视频理解和世界建模的可扩展研究。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 11 篇

2503.17523 2026-01-16 cs.CL cs.AI 81%

Bayesian Teaching Enables Probabilistic Reasoning in Large Language Models

贝叶斯教学使大语言模型具备概率推理能力

Linlu Qiu, Fei Sha, Kelsey Allen, Yoon Kim, Tal Linzen, Sjoerd van Steenkiste

机构 * MIT(麻省理工学院) Meta Google(谷歌公司) DeepMind University of British Columbia(不列颠哥伦比亚大学深度思维学院) Vector Institute(向量研究所) New York University(纽约大学) Google Research(谷歌研究)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过教学使大语言模型模仿贝叶斯模型预测,提升其概率推理能力并推广至新任务。

Comments Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09855 2026-01-16 cs.AI cs.CL 81%

Thinking Long, but Short: Stable Sequential Test-Time Scaling for Large Reasoning Models

深入思考,但简短:大型推理模型的稳定序列测试时间扩展

Michael R. Metel, Yufei Cui, Boxing Chen, Prasanna Parthasarathi

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Min-Seek方法,通过高效管理KV缓存实现大型推理模型在扩展推理长度时的稳定性与准确性提升。

Comments Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏