arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-12 至 2026-01-12 共收录 71 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 18 篇

2601.05445 2026-01-12 cs.CR cs.LG 57%

Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models

基于知识的多轮对抗攻击大语言模型

Songze Li, Ruishi He, Xiaojun Jia, Jun Wang, Zhihui Fu

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学) OPPO Research Institute(OPPO研究院)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 Mastermind通过动态知识库和分层规划架构,实现对大语言模型的高效多轮对抗攻击,显著提升攻击效果和防御韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05887 2026-01-12 cs.CR 50%

Cybersecurity AI: A Game-Theoretic AI for Guiding Attack and Defense

网络空间AI:一种基于博弈论的AI用于引导攻击与防御

Víctor Mayoral-Vilches, María Sanz-Gómez, Francesco Balassone, Stefan Rass, Lidia Salas-Espejo, Benjamin Jablonski, Luis Javier Navarrete-Lozano, Maite del Mundo de Torres, Cristóbal R. J. Veas Chavez

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出G-CTR,一种基于博弈论的AI指导层,通过生成摘要引导攻击与防御行为,提升网络安全测试效率与成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05606 2026-01-12 cs.MA 50%

Conformity Dynamics in LLM Multi-Agent Systems: The Roles of Topology and Self-Social Weighting

LLM多智能体系统中的从众动力学:拓扑结构与自我-社会权重的作用

Chen Han, Jin Tan, Bohan Yu, Wenzhen Zheng, Xijin Tang

专题命中 规划推理 :reasoning(abstract)

AI总结 本文研究了LLM多智能体系统中网络拓扑和自我-社会权重对集体决策效率、鲁棒性及失败模式的影响。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 3 篇

2601.05600 2026-01-12 cs.CV cs.CL cs.LG 81%

SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes

SceneAlign: 在复杂视觉场景中将多模态推理对齐到场景图

Chuhan Wang, Xintong Li, Jennifer Yuntong Zhang, Junda Wu, Chengkai Huang, Lina Yao, Julian McAuley, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Toronto(多伦多大学) University of New South Wales(新南威尔士大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 SceneAlign通过利用场景图进行结构干预,提升多模态推理在复杂视觉场景中的准确性和忠实性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05172 2026-01-12 cs.CV cs.AI 79%

CoV: Chain-of-View Prompting for Spatial Reasoning

CoV:基于视角链的立体推理

Haoyu Zhao, Akide Liu, Zeyu Zhang, Weijie Wang, Feng Chen, Ruihan Zhu, Gholamreza Haffari, Bohan Zhuang

机构 * ZIP Lab, Zhejiang University(浙江大学ZIP实验室) Monash University(墨尔本大学) AIML, Adelaide University(阿德莱德大学AIML)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 CoV通过链式视角提示方法提升3D具身问答中的空间推理能力,无需额外训练。

Comments Code link https://github.com/ziplab/CoV

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05336 2026-01-12 cs.RO 56%

Intent at a Glance: Gaze-Guided Robotic Manipulation via Foundation Models

意图一目了然:通过基础模型实现的注视引导的机器人操作

Tracey Yee Hsin Tay, Xu Yan, Jonathan Ouyang, Daniel Wu, William Jiang, Jonathan Kao, Yuchen Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉空间推理 :reasoning(abstract);planning(comments)

AI总结 GAMMA通过结合基础模型和注视技术,实现无需特定任务训练的机器人操作自主控制,提升人机交互的直观性和可扩展性。

Comments Accepted to 2025 RSS Robot Planning in the Era of Foundation Models (FM4RoboPlan) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 4 篇

2601.05593 2026-01-12 cs.LG 88%

PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning

PaCoRe: 通过并行协调推理学习扩展测试时间计算

Jingcheng Hu, Yinmin Zhang, Shijie Shang, Xiaobo Yang, Yue Peng, Zhewei Huang, Hebin Zhou, Xin Wu, Jie Cheng, Fanqi Wan, Xiangwen Kong, Chengyuan Yao, Kaiwen Yan, Ailin Huang, Hongyu Zhou, Qi Han, Zheng Ge, Daxin Jiang, Xiangyu Zhang, Heung-Yeung Shum

机构 * StepFun Tsinghua University(清华大学) Peking University(北京大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);分类 cs.LG

AI总结 PaCoRe通过并行协调推理框架,实现大规模测试时间计算扩展,提升数学推理能力至94.5%

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11847 2026-01-12 cs.LG cs.AI 84%

Tiny Recursive Models on ARC-AGI-1: Inductive Biases, Identity Conditioning, and Test-Time Compute

在ARC-AGI-1上使用小型递归模型:归纳偏差、身份条件和测试时计算

Antonio Roye-Azar, Santiago Vargas-Naranjo, Dhruv Ghai, Nithin Balamurugan, Rayan Amir

机构 * Western University(西部大学) Varonova Tech Inc.(Varonova科技公司)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究分析了TRM在ARC-AGI-1上的表现,发现其性能源于效率、任务特定条件和测试时计算的相互作用,而非深度推理。

Comments 13 pages, 0 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21825 2026-01-12 cs.LG cs.AI cs.CL 82%

Let Me Think! A Long Chain-of-Thought Can Be Worth Exponentially Many Short Ones

让我思考!一个长的推理链可能比许多短的链多出指数倍

Parsa Mirtaheri, Ezra Edelman, Samy Jelassi, Eran Malach, Enric Boix-Adsera

机构 * UC San Diego(UC圣地亚哥大学) University of Pennsylvania(宾夕法尼亚大学) Harvard University(哈佛大学)

专题命中 测试时计算 :chain-of-thought(title);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了推理链扩展策略,证明在特定图连通性问题中顺序扩展比并行扩展更有效。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08098 2026-01-12 cs.CL cs.AI 81%

The Price of Thought: A Multilingual Analysis of Reasoning, Performance, and Cost of Negotiation in Large Language Models

思考的成本:多语言下大型语言模型谈判能力、表现与成本的分析

Sherzod Hakimov, Roland Bernard, Tim Leiber, Karl Osswald, Kristina Richert, Ruilin Yang, Raffaella Bernardi, David Schlangen

机构 * Computational Linguistics, Department of Linguistics University of Potsdam(波恩-博兹恩大学语言学系) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI)) Free University of Bozen-Bolzano(博兹恩-博尔扎诺自由大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究分析了多语言环境下大型语言模型谈判能力的表现与成本,发现启用推理能提升谈判效果但增加计算成本,且开源模型在多语言谈判中倾向于使用英语推理。

Comments Accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 7 篇

2601.05459 2026-01-12 cs.CL cs.AI 88%

Do LLMs Need Inherent Reasoning Before Reinforcement Learning? A Study in Korean Self-Correction

LLMs是否需要在强化学习前具备内在推理能力?韩国自我修正研究

Hongjin Kim, Jaewook Lee, Kiyoung Lee, Jong-hun Shin, Soojong Lim, Oh-Woog Kwon

机构 * ETRI

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨LLMs在强化学习前是否需要具备内在推理能力,通过韩国自我修正研究发现,对齐模型内部推理与韩语输入关键,提升多语言推理效果。

Comments IJCNLP-AACL 2025 (Main), Outstanding Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04651 2026-01-12 cs.AI cs.IR cs.MA 83%

Adversarial Yet Cooperative: Multi-Perspective Reasoning in Retrieved-Augmented Language Models

对抗 yet 合作:检索增强语言模型中的多视角推理

Can Xu, Lingyong Yan, Jiayi Wu, Haosen Wang, Shuaiqiang Wang, Yuchen Li, Jizhou Huang, Dawei Yin, Xiang Li

机构 * East China Normal University(华东师范大学) Baidu Inc.(百度公司) Southeast University(东南大学)

专题命中 复杂问题求解 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出对抗推理RAG框架,通过推理与验证的对抗机制提升检索增强语言模型的多视角推理能力与验证严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11930 2026-01-12 cs.CV cs.AI 83%

AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning

AtomThink: 多模态慢思考与原子步骤推理

Kun Xiang, Zhili Liu, Terry Jingchen Zhang, Yinya Huang, Yunshuang Nie, Kaixin Cai, Yiyang Yin, Runhui Huang, Hanhui Li, Yihan Zeng, Yu-Jie Yuan, Jianhua Han, Lanqing Hong, Hang Xu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ETH Zurich(苏黎世联邦理工学院) Hong Kong University of Science and Technology(香港科技大学) University of Hong Kong(香港大学) Noah’s Ark Lab(诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿纬智能科技有限公司)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 AtomThink通过引入原子步骤推理,提升多模态大语言模型的推理性能和效率。

Comments TPAMI accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02954 2026-01-12 cs.CL 77%

DQ-LoRe: Dual Queries with Low Rank Approximation Re-ranking for In-Context Learning

DQ-LoRe:双查询与低秩近似重排序用于上下文学习

Jing Xiong, Zixuan Li, Chuanyang Zheng, Zhijiang Guo, Yichun Yin, Enze Xie, Zhicheng Yang, Qingxing Cao, Haiming Wang, Xiongwei Han, Jing Tang, Chengming Li, Xiaodan Liang

机构 * Sun Yat-Sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Huawei Noah’s Ark Lab(华为诺亚实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) MBZUAI The Hong Kong University of Science and Technology(香港科学与技术大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) DarkMatter AI Research(DarkMatter AI研究)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 DQ-LoRe通过双查询与低秩近似重排序方法提升GPT-4上下文学习性能,实现94.2%的性能提升。

Comments Accepted in ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05259 2026-01-12 cs.IR 67%

A Technical Report on the Second Place Solution for the CIKM 2025 AnalytiCup Competition

CIKM 2025 AnalytiCup竞赛第二名解决方案的技术报告

Haotao Xie, Ruilin Chen, Yicheng Wu, Zhan Zhao, Yuanyuan Liu

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出基于提示工程与任务分解的单模型框架,通过低秩适应提升多语言电商搜索相关性判断效率,取得竞赛优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05256 2026-01-12 cs.AI cs.CL cs.CV cs.IR 62%

Naiad: Novel Agentic Intelligent Autonomous System for Inland Water Monitoring

Naiad:一种新型智能自主系统用于内陆水体监测

Eirini Baltzi, Tilemachos Moumouris, Athena Psalta, Vasileios Tsironis, Konstantinos Karantzalos

机构 * National Technical University of Athens(希腊国家技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Naiad是一种基于大语言模型和外部工具的智能系统,用于通过地球观测数据实现内陆水体的全面监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05688 2026-01-12 cs.CV 50%

SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More

SketchVL:通过细粒度信用分配进行政策优化以实现图表理解和更多

Muye Huang, Lingling Zhang, Yifei Li, Yaqiang Wu, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University, China(计算机科学与技术学院,西安交通大学) MOE KLINNS Lab, Xi’an Jiaotong University, China(教育部KLINNS实验室,西安交通大学) Zhongguancun Academy, Beijing, China(中关村学院,北京)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 SketchVL通过细粒度信用分配优化,提升多模态大语言模型在图表理解和多领域推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 12 篇

2601.05567 2026-01-12 cs.AI cs.CL 81%

WildSci: Advancing Scientific Reasoning from In-the-Wild Literature

WildSci: 从真实文献中推进科学推理

Tengxiao Liu, Deepak Nathani, Zekun Li, Kevin Yang, William Yang Wang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 WildSci通过自动合成领域特定科学问题数据集,提升科学推理的可扩展性和可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05693 2026-01-12 cs.AI 79%

Circular Reasoning: Understanding Self-Reinforcing Loops in Large Reasoning Models

循环推理:理解大推理模型中的自增强循环

Zenghao Duan, Liang Pang, Zihao Wei, Wenbin Duan, Yuxin Tian, Shicheng Xu, Jingcheng Deng, Zhiyi Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) People’s Public Security University of China(中国人民公安大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出LoopBench数据集和CUSUM算法,用于识别和预测大型推理模型中的自增强循环问题,揭示循环推理的机理并提升模型稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04996 2026-01-12 cs.AI 79%

AlgBench: To What Extent Do Large Reasoning Models Understand Algorithms?

AlgBench: 大型推理模型对算法的理解程度有多高?

Henan Sun, Kaichi Yu, Yuyao Wang, Bowen Liu, Xunkai Li, Rong-Hua Li, Nuo Chen, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 AlgBench通过算法为中心的基准测试揭示大型推理模型在算法理解上的性能差异和局限性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21329 2026-01-12 cs.CL 79%

Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning Benchmarks

你的推理基准可能并未测试推理:揭示抽象推理基准中的感知瓶颈

Xinhe Wang, Jin Huang, Xingjian Zhang, Tianhao Wang, Jiaqi W. Ma

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究发现抽象推理基准中的性能差距主要源于视觉感知限制,而非推理能力不足,需设计分离感知与推理的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09993 2026-01-12 cs.AI 79%

SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models

SPAN:大型语言模型跨日历时间推理的基准测试与改进

Zhongjian Miao, Hao Fu, Chen Wei

机构 * Li Auto(利亚特)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SPAN通过开发时间代理提升大型语言模型跨日历时间推理能力,实验显示其准确率高达95.31%

Comments Accepted at the AAAI 2026 conference. This version includes the supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05432 2026-01-12 cs.CV cs.AI cs.CL 73%

Thinking with Map: Reinforced Parallel Map-Augmented Agent for Geolocalization

基于地图的思考:用于地理定位的强化并行地图增强智能体

Yuxiang Ji, Yong Wang, Ziyu Ma, Yiming Hu, Hailang Huang, Xuecai Hu, Guanhua Chen, Liaoni Wu, Xiangxiang Chu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里集团AMAP) Southern University of Science and Technology(南方科技大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于地图的强化并行智能体,通过两阶段优化提升地理定位精度,实验显示在Acc@500m指标上显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01739 2026-01-12 cs.CL cs.AI 62%

K-EXAONE Technical Report

K-EXAONE 技术报告

Eunbi Choi, Kibong Choi, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Hyunjik Jo, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Haeju Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Heuiyeen Yeen, Hwan Chang, Stanley Jungkyu Choi, Yejin Choi, Jiwon Ham, Kijeong Jeon, Geunyeong Jeong, Gerrard Jeongwon Jo, Yonghwan Jo, Jiyeon Jung, Naeun Kang, Dohoon Kim, Euisoon Kim, Hayeon Kim, Hyosang Kim, Hyunseo Kim, Jieun Kim, Minu Kim, Myoungshin Kim, Unsol Kim, Youchul Kim, YoungJin Kim, Chaeeun Lee, Chaeyoon Lee, Changhun Lee, Dahm Lee, Edward Hwayoung Lee, Honglak Lee, Jinsang Lee, Jiyoung Lee, Sangeun Lee, Seungwon Lim, Solji Lim, Woohyung Lim, Chanwoo Moon, Jaewoo Park, Jinho Park, Yongmin Park, Hyerin Seo, Wooseok Seo, Yongwoo Song, Sejong Yang, Sihoon Yang, Chang En Yea, Sihyuk Yi, Chansik Yoon, Dongkeun Yoon, Sangyeon Yoon, Hyeongu Yun

机构 * LG AI Research(LG人工智能研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 K-EXAONE是一款由LG AI Research开发的大型多语言语言模型,基于专家混合架构,支持256K-token上下文窗口,具备多语言能力,其性能与同类开源模型相当,适用于多种工业和研究应用。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19153 2026-01-12 cs.CR cs.AI cs.SE 57%

LLMs as verification oracles for Solidity

LLMs作为Solidity的验证或者

Massimo Bartoletti, Enrico Lipparini, Livio Pompianu

机构 * University of Cagliari, Italy(卡利亚里大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了使用LLMs评估Solidity合同属性有效性的潜力,通过实证研究展示其在智能合约验证中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04160 2026-01-12 cs.CL cs.CE q-fin.CP 57%

All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection

并非所有发光的都是金子:一个无参考信息的反事实金融虚假信息检测基准

Yuechen Jiang, Zhiwei Liu, Yupeng Cao, Yueru He, Ziyang Xu, Chen Xu, Zhiyang Deng, Prayag Tiwari, Xi Chen, Alejandro Lopez-Lira, Jimin Huang, Junichi Tsujii, Sophia Ananiadou

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 RFC Bench通过对比上下文提升金融虚假信息检测性能,揭示无参考设置下的模型局限性。

Comments 48 pages; 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05927 2026-01-12 cs.CV 50%

Adapting Vision Transformers to Ultra-High Resolution Semantic Segmentation with Relay Tokens

适应于超高分辨率语义分割的视觉变换器:通过中继标记

Yohann Perron, Vladyslav Sydorov, Christophe Pottier, Loic Landrieu

专题命中 推理评测 :reasoning(abstract)

AI总结 通过引入中继标记,该方法在视觉变换器中实现多尺度推理,提升超高清语义分割的性能,实现局部细节与全局意识的平衡。

Comments 13 pages +3 pages of suppmat

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21272 2026-01-12 cs.CV 50%

Co-Training Vision Language Models for Remote Sensing Multi-task Learning

联合训练遥感多任务学习的视觉语言模型

Qingyun Li, Shuran Ma, Junwei Luo, Yi Yu, Yue Zhou, Fengxiang Wang, Xudong Lu, Xiaoxing Wang, Xin He, Yushi Chen, Xue Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学) Xidian University(西安电子科技大学) East China Normal University(东华大学) Wuhan University(武汉大学) Southeast University(东南大学) National University of Defense Technology(国防科技大学) Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 RSCoVLM通过联合训练视觉语言模型,提升遥感多任务学习的性能和灵活性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05632 2026-01-12 eess.SY cs.SY 50%

LLM-DMD: Large Language Model-based Power System Dynamic Model Discovery

基于大语言模型的电力系统动态模型发现:LLM-DMD

Chao Shen, Zihan Guo, Ke Zuo, Wenqi Huang, Mingyang Sun

专题命中 推理评测 :reasoning(abstract)

AI总结 LLM-DMD通过结合大语言模型的推理和代码生成能力,利用两个循环发现电力系统动态方程并强制代数约束,从而实现高保真动态模型的构建。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他推理 12 篇

2601.04992 2026-01-12 cs.CL 85%

Learning from Mistakes: Negative Reasoning Samples Enhance Out-of-Domain Generalization

从错误中学习:负推理样本增强领域外泛化

Xueyun Tian, Minghua Ma, Bingbing Xu, Nuoyan Lyu, Wei Li, Heng Dong, Zheng Chu, Yuanzhuo Wang, Huawei Shen

机构 * CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院,北京,中国) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学,哈尔滨,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 通过引入负例推理样本,GLOW方法有效提升了大语言模型在领域外任务中的泛化能力,通过调节损失下降和提升策略熵来减少过拟合并促进探索。

Comments Code and data are available at https://github.com/Eureka-Maggie/GLOW

详情

展开后加载摘要…

URL PDF HTML 收藏