arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-30 至 2026-01-30 共收录 258 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 36 篇

2601.21894 2026-01-30 cs.LG 83%

Not All Code Is Equal: A Data-Centric Study of Code Complexity and LLM Reasoning

并非所有代码都同等重要:一项以数据为中心的代码复杂度与大语言模型推理研究

Lukas Twist, Shu Yang, Hanqi Yan, Jingzhi Gong, Di Wang, Helen Yannakoudakis, Jie M. Zhang

机构 * King's College London, United Kingdom(伦敦国王学院) King Abdullah University of Science(阿卜杜勒阿齐兹国王科学大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过研究代码结构复杂性对大语言模型推理能力的影响,发现结构特性在提升推理性能中起关键作用,优于单纯扩大训练数据规模。

Comments 16 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21199 2026-01-30 cs.CV cs.AI 83%

Thinker: A vision-language foundation model for embodied intelligence

Thinker:一个用于具身智能的视觉-语言基础模型

Baiyu Pan, Daqin Luo, Junpeng Yang, Jiyuan Wang, Yixuan Zhang, Hailin Shi, Jichao Jiao

专题命中 推理与问题求解 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 Thinker通过构建大规模数据集和改进输入方式,在机器人感知与推理任务中实现了最先进的性能。

Comments IROS 2025, 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10996 2026-01-30 cs.CL 83%

RAS: Retrieval-And-Structuring for Knowledge-Intensive LLM Generation

RAS:基于检索与构建的知识密集型大语言模型生成

Pengcheng Jiang, Lang Cao, Ruike Zhu, Minhao Jiang, Yunyi Zhang, Jiaming Shen, Jimeng Sun, Jiawei Han

机构 * Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RAS通过动态构建问题特定知识图谱,提升大语言模型在知识密集型任务中的推理准确性和鲁棒性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21192 2026-01-30 cs.AI cs.CL 82%

Do Reasoning Models Enhance Embedding Models?

推理模型能增强嵌入模型吗?

Wun Yu Chan, Shaojin Chen, Huihao Jing, Kwun Hang Lau, Elton Chun-Chai Li, Zihao Wang, Haoran Li, Yangqiu Song

机构 * CSE, HKUST(香港科技大学计算机科学与工程系)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文研究了推理模型是否能提升嵌入模型的性能,发现其初始化对对比学习效果无显著影响,并提出HRSA框架揭示流形重新对齐现象。

Comments 10 main pages, 18 appendix pages, 13 figures, 11 tables, 4 prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22035 2026-01-30 cs.CL cs.AI 81%

Thinking Out of Order: When Output Order Stops Reflecting Reasoning Order in Diffusion Language Models

脱离顺序思考:当输出顺序不再反映推理顺序时扩散语言模型的表现

Longxuan Yu, Yu Fu, Shaorong Zhang, Hui Liu, Mukund Varma T, Greg Ver Steeg, Yue Dong

机构 * University of California, Riverside, CA, USA(加州大学河滨分校) Independent Researcher(独立研究者) University of California, San Diego, CA, USA(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出屏蔽扩散语言模型(MDLMs)在处理输出顺序与推理顺序不一致时展现出的顺序鲁棒性,通过实验验证其在不同基准上的稳定性能。

Comments 18 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17915 2026-01-30 cs.AI cs.LG cs.LO 81%

Think Locally, Explain Globally: Graph-Guided LLM Investigations via Local Reasoning and Belief Propagation

局部思考,全球解释:通过局部推理和信念传播的图引导LLM研究

Saurabh Jha, Rohan Arora, Bhavya, Noah Zheutlin, Paulina Toro Isaza, Laura Shwartz, Yu Deng, Daby Sow, Ruchi Mahindru, Ruchir Puri

机构 * IBM Research(IBM研究院)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 EoG通过图引导的局部推理和信念传播提升LLM在开放性研究中的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21634 2026-01-30 cs.CV 80%

RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning

RSGround-R1: 重新思考通过空间推理的遥感视觉定位

Shiqi Huang, Shuting He, Bihan Wen

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(电气电子工程学院,南洋理工大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics, Shanghai University of Finance and Economics(教育部计算与经济交叉学科重点实验室,上海财经大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 RSGround-R1通过引入空间推理引导的后训练框架,提升遥感图像中目标物体的定位精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21533 2026-01-30 cs.AI 79%

ARGORA: Orchestrated Argumentation for Causally Grounded LLM Reasoning and Decision Making

ARGORA:用于因果基础的大语言模型推理和决策的协同论证

Youngjin Jin, Hanna Kim, Kwanwoo Kim, Chanhee Lee, Seungwon Shin

机构 * School of EE, KAIST, Daejeon, South Korea(韩国科学技术院电子工程学院) S2W Inc., Pangyo, South Korea(S2W公司)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 ARGORA通过构建因果论证图,提升大语言模型在因果推理和决策中的准确性与修正能力。

Comments 58 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18196 2026-01-30 cs.CL 79%

LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision

LogicReward: 通过逐步逻辑监督激励大语言模型推理

Jundong Xu, Hao Fei, Huichi Zhou, Xin Quan, Qijun Huang, Shengqiong Wu, William Yang Wang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University College London(伦敦大学学院) University of Manchester(曼彻斯特大学) University of Melbourne(墨尔本大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL

AI总结 LogicReward通过逐步逻辑监督提升大语言模型的推理能力,有效增强推理可信度和泛化能力,实验显示其在自然语言推理和逻辑推理任务中优于GPT-4o和o4-mini。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21590 2026-01-30 cs.LG cs.AI 79%

Scalable Power Sampling: Unlocking Efficient, Training-Free Reasoning for LLMs via Distribution Sharpening

可扩展的功率采样:通过分布锐化实现LLM的高效无训练推理

Xiaotong Ji, Rasul Tutunov, Matthieu Zimmer, Haitham Bou Ammar

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无训练、无验证器的算法,通过分布锐化提升LLM的推理效率,减少计算成本,实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21000 2026-01-30 cs.CL cs.AI 79%

UrduBench: An Urdu Reasoning Benchmark using Contextually Ensembled Translations with Human-in-the-Loop

UrduBench: 一种基于上下文融合翻译的人工参与推理基准测试

Muhammad Ali Shafique, Areej Mehboob, Layba Fiaz, Muhammad Usman Qadeer, Hamza Farooq

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出UrduBench,通过上下文融合翻译和人工参与验证,构建乌尔都语推理基准测试,评估不同模型在多种提示策略下的表现,揭示多步骤推理在乌尔都语中的挑战及语言对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00190 2026-01-30 cs.CL cs.AI 79%

Explainable Chain-of-Thought Reasoning: An Empirical Analysis on State-Aware Reasoning Dynamics

可解释的链式思维推理:对状态感知推理动态的实证分析

Sheldon Yu, Yuxin Xiong, Junda Wu, Xintong Li, Tong Yu, Xiang Chen, Ritwik Sinha, Jingbo Shang, Julian McAuley

机构 * University of California San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种状态感知的转换框架,通过结构化潜在动态分析链式思维推理的语义演变和转换,提升推理过程的可解释性。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21617 2026-01-30 cs.CV 78%

PathReasoner-R1: Instilling Structured Reasoning into Pathology Vision-Language Model via Knowledge-Guided Policy Optimization

PathReasoner-R1: 通过知识引导的策略优化在病理视觉-语言模型中引入结构化推理

Songhan Jiang, Fengchun Liu, Ziyue Wang, Linghan Cai, Yongbing Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) Technical University of Dresden(德累斯顿技术大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 PathReasoner-R1通过知识引导的策略优化,在病理视觉-语言模型中引入结构化推理,提升模型的临床推理能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11479 2026-01-30 cs.AI 77%

Health Facility Location in Ethiopia: Leveraging LLMs to Integrate Expert Knowledge into Algorithmic Planning

埃塞俄比亚卫生设施选址:利用大语言模型整合专家知识到算法规划中

Yohai Trabelsi, Guojun Xiong, Fentabil Getnet, Stéphane Verguet, Milind Tambe

机构 * John A. Paulson School of Engineering and Applied Sciences, Harvard University(工程与应用科学学院,哈佛大学) National Data Management and Analytics Center for Health, Ethiopian Public Health Institute(健康数据管理与分析中心,埃塞俄比亚公共卫生研究所) Department of Global Health and Population, Harvard T.H. Chan School of Public Health(全球卫生与人口学院,哈佛T.H. Chan公共卫生学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种结合大语言模型和优化技术的混合框架,用于埃塞俄比亚卫生设施选址,以整合专家知识并提升规划的公平性和数据驱动性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08182 2026-01-30 cs.LG 77%

CTRLS: Chain-of-Thought Reasoning via Latent State-Transition

CTRLS: 通过潜在状态转移进行链式推理

Junda Wu, Yuxin Xiong, Xintong Li, Sheldon Yu, Zhengmian Hu, Tong Yu, Rui Wang, Xiang Chen, Jingbo Shang, Julian McAuley

机构 * University of California, San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CTRLS通过建模潜在状态转移的马尔可夫决策过程,利用分布式强化学习提升大语言模型的推理能力与探索效率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21742 2026-01-30 cs.AI cs.CL cs.MA 76%

Epistemic Context Learning: Building Trust the Right Way in LLM-Based Multi-Agent Systems

知识上下文学习:在基于大语言模型的多智能体系统中以正确方式建立信任

Ruiwen Zhou, Maojia Song, Xiaobao Wu, Sitao Cheng, Xunjian Yin, Yuxi Xie, Zhuoqun Hao, Wenyue Hua, Liangming Pan, Soujanya Poria, Min-Yen Kan

机构 * National University of Singapore(国立新加坡大学) Singapore University of Technology(新加坡科技学院) Nanyang Technological University(南洋理工大学) Duke University(杜克大学) University of Waterloo(滑铁卢大学) Microsoft(微软公司) Peking University(北京大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.CL、cs.AI

AI总结 本文提出Epistemic Context Learning(ECL),通过历史交互构建同伴资料以提升多智能体系统中信任建模的准确性,使小型模型在性能上超越大模型,并在多种配置中表现出良好的泛化能力。

Comments Codes and data are available at https://github.com/skyriver-2000/epistemic-context-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01559 2026-01-30 cs.SD 75%

LLM2Fx-Tools: Tool Calling For Music Post-Production

LLM2Fx-Tools: 音乐后期制作中的工具调用

Seungheon Doh, Junghyun Koo, Marco A. Martínez-Ramírez, Woosung Choi, Wei-Hsiang Liao, Qiyu Wu, Juhan Nam, Yuki Mitsufuji

机构 * KAIST(韩国科学技术院) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 LLM2Fx-Tools通过LLM实现音频效果模块的工具调用,生成可执行的音频效果序列,提升音乐后期制作的可解释性和可控性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21711 2026-01-30 cs.CL cs.AI 73%

TACLer: Tailored Curriculum Reinforcement Learning for Efficient Reasoning

TACLer: 针对高效推理的定制课程强化学习

Huiyuan Lai, Malvina Nissim

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) Center for Language and Cognition (CLCG), University of Groningen, The Netherlands(语言与认知中心(CLCG),格罗宁根大学,荷兰)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TACLer通过定制课程强化学习提升推理效率,减少计算成本并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21936 2026-01-30 cs.AI 70%

AgenticSimLaw: A Juvenile Courtroom Multi-Agent Debate Simulation for Explainable High-Stakes Tabular Decision Making

AgenticSimLaw: 一个面向可解释高风险表格决策的青少年法庭多智能体辩论模拟

Jon Chun, Kathrine Elkins, Yong Suk Lee

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 AgenticSimLaw通过结构化多智能体辩论框架提升高风险表格决策的可解释性和稳定性,适用于需要透明和人类监督的决策任务。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21804 2026-01-30 cs.CL 70%

Distribution-Aware Reward Estimation for Test-Time Reinforcement Learning

面向分布的奖励估计用于测试时强化学习

Bodong Du, Xuanqi Huang, Xiaomeng Li

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong, China(电子与计算机工程系,香港科学与技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DARE通过利用回放分布而非单一多数结果来改进测试时强化学习的奖励估计,提高了优化稳定性和最终性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21598 2026-01-30 cs.AI 70%

Beyond Imitation: Reinforcement Learning for Active Latent Planning

超越模仿:用于主动潜在规划的强化学习

Zhi Zheng, Wee Sun Lee

机构 * School of Computing, National University of Singapore, Singapore(计算学院,新加坡国立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ATP-Latent方法,通过主动规划和强化学习优化潜在空间,提升链式推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25851 2026-01-30 cs.CV 67%

MuSLR: Multimodal Symbolic Logical Reasoning

MuSLR:多模态符号逻辑推理

Jundong Xu, Hao Fei, Yuhui Zhang, Liangming Pan, Qijun Huang, Qian Liu, Preslav Nakov, Min-Yen Kan, William Yang Wang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Stanford University(斯坦福大学) Peking University(北京大学) UniMelb(墨尔本大学) University of Auckland(奥克兰大学) MBZUAI(穆斯林人工智能研究所) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract)

AI总结 MuSLR提出了一种多模态符号逻辑推理基准,通过形式逻辑规则提升VLMs的推理能力,显著提升链式推理性能及复杂逻辑处理效果。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21418 2026-01-30 cs.LG cs.AI 62%

Mitigating Overthinking in Large Reasoning Models via Difficulty-aware Reinforcement Learning

通过难度感知强化学习缓解大推理模型中的过度思考

Qian Wan, Ziao Xu, Luona Wei, Xiaoxuan Shen, Jianwen Sun

机构 * Laboratory for Artificial Intelligence and New Forms of Education(人工智能与新教育形式实验室) National Engineering Research Center of Educational Big Data(教育大数据国家工程研究中心) Faculty of Artificial Intelligence in Education, Central China Normal University(教育人工智能学院,中央财经大学) College of Electronics and Information Engineering, South-Central Minzu University(电子与信息工程学院,西南民族大学)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DiPO框架,通过难度感知强化学习缓解大推理模型的过度思考问题,提升推理效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21051 2026-01-30 cs.AI cs.CR cs.LG 62%

Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B Technical Report

Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B 技术报告

Zhuoran Yang, Ed Li, Jianliang He, Aman Priyanshu, Baturay Saglam, Paul Kassianik, Sajana Weerawardhena, Anu Vellore, Blaine Nelson, Neusha Javidnia, Arthur Goldblatt, Fraser Burch, Avi Zohary, Assaf Eisenman, Mahdi Sabbaghi, Supriti Vijay, Rahim Dharssi, Dhruv Kedia, Kojin Oshiba, Yaron Singer, Amin Karbasi

机构 * Foundation AI–Cisco Systems Inc.(Foundation AI–Cisco系统公司) Yale University(耶鲁大学) University of California, San Diego(加州大学圣地亚哥分校) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.AI、cs.LG

AI总结 Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B 是首个开源的网络安全专用推理模型,通过结合监督微调和强化学习训练,实现了在网络安全任务上的高性能表现。

Comments 31 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21978 2026-01-30 cs.LG 57%

Bridging Graph Structure and Knowledge-Guided Editing for Interpretable Temporal Knowledge Graph Reasoning

弥合图结构与知识引导编辑以实现可解释的时序知识图谱推理

Shiqi Fan, Quanming Yao, Hongyi Nie, Wentao Ma, Zhen Wang, Wen Hua

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) School of Cybersecurity, Northwestern Polytechnical University(网络安全学院,西北工业大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学) School of Mechanical Engineering, Northwestern Polytechnical University(机械工程学院,西北工业大学) School of Mathematics and Statistics, Xi’an Jiaotong University(数学与统计学院,西安交通大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG

AI总结 IGETR通过结合图神经网络与大语言模型,实现可解释的时序知识图谱推理,提升预测准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04575 2026-01-30 cs.AI 57%

Scaling Behavior Cloning Improves Causal Reasoning: An Open Model for Real-Time Video Game Playing

规模行为克隆提升因果推理:一个用于实时视频游戏播放的开放模型

Yuguang Yue, Irakli Salia, Samuel Hunt, Chris Green, Wenzhe Shi, Jonathan J Hunt

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 本研究提出了一种开放的训练方法,通过扩大模型和数据规模提升因果推理能力,展示了在实时视频游戏中的高性能表现。

Comments 27 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21821 2026-01-30 cs.CV 50%

MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods

MMFineReason: 通过以开放数据为中心的方法缩小多模态推理差距

Honglin Lin, Zheng Liu, Yun Zhu, Chonghan Qin, Juekai Lin, Xiaoran Shang, Conghui He, Wentao Zhang, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室、OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 MMFineReason通过大规模多模态推理数据集和基于难度的过滤策略,提升模型推理能力与参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 59 篇

2512.16453 2026-01-30 cs.AI 92%

TimeSeries2Report prompting enables adaptive large language model management of lithium-ion batteries

TimeSeries2Report提示使大语言模型适应性管理锂离子电池

Jiayang Yang, Martin Guay, Zhixing Cao, Chunhui Zhao

机构 * State Key Laboratory of Industrial Control Technology, College of Control Science and Engineering, Zhejiang University, Hangzhou, 310027, China(工业控制技术国家重点实验室,控制科学与工程学院,浙江大学,杭州,310027,中国) Department of Chemical Engineering, Queen’s University, Kingston, Ontario K7L 3N6, Canada(化学工程系,皇后大学,金斯顿,安大略省K7L 3N6,加拿大)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

AI总结 TimeSeries2Report通过将时间序列数据转化为结构化报告,提升大语言模型在锂离子电池管理中的适应性和决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14038 2026-01-30 cs.AI cs.CL cs.IR 92%

OAEI-LLM: A Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching

OAEI-LLM:用于理解本体匹配中大语言模型幻觉的基准数据集

Zhangcheng Qiang, Kerry Taylor, Weiqing Wang, Jing Jiang

机构 * Australian National University, School of Computing(澳大利亚国立大学,计算机学院) Monash University, Faculty of Information Technology(墨尔本大学,信息技术学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 OAEI-LLM数据集旨在通过评估本体匹配任务中大语言模型的幻觉现象,为理解LLM幻觉提供基准支持。

Comments 5 pages, 1 figure, 1 table, 1 code snippet

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03827 2026-01-30 cs.AI 91%

What Would an LLM Do? Evaluating Large Language Models for Policymaking to Alleviate Homelessness

LLM会怎么做?评估大型语言模型在缓解贫困中的政策制定应用

Pierre Le Coz, Jia An Liu, Debarun Bhattacharjya, Georgina Curto, Serge Stinckwich

机构 * United Nations University Institute in Macau(联合国大学澳门研究所) IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.AI

AI总结 本文评估LLMs在缓解贫困中的政策建议一致性,提出基于能力方法的基准,并探讨LLMs与专家结合使用在政策制定中的潜在价值。

Comments Added a 2nd expert's local-scenario annotations (Table 1 updated with inter-expert consensus); strengthened motivation & domain-expert engagement; expanded related work; replaced ROUGE-L with Sentence-BERT semantic similarity for justification analysis; clarified evaluation non-circularity (Sec. 4.1); deepened results analysis (local context responsiveness/bias); refined limitations & future work

详情

展开后加载摘要…

URL PDF HTML 收藏