arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-02 至 2026-02-02 共收录 285 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 53 篇

2510.15522 2026-02-02 cs.CL 79%

LLM Latent Reasoning as Chain of Superposition

LLM潜在推理作为叠加链

Jingcheng Deng, Liang Pang, Zihao Wei, Shicheng Xu, Zenghao Duan, Kun Xu, Yang Song, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京)

专题命中 推理与问题求解 :LLM(title);SFT(abstract);分类 cs.CL

AI总结 本文提出Latent-SFT框架,通过约束隐藏状态、构建语义紧凑的链结构以及使用随机Gumbel-Softmax优化,实现LLM潜在推理的高效叠加,提升数学基准任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11352 2026-02-02 cs.AI cs.FL 79%

Foundation Models for Logistics: Toward Certifiable, Conversational Planning Interfaces

物流领域的基础模型:迈向可验证、对话式规划界面

Yunhao Yang, Neel P. Bhatt, Christian Ellis, Samuel Li, Alvaro Velasquez, Zhangyang Wang, Ufuk Topcu

机构 * Neurosymbolic Intelligence(神经符号智能) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Colorado Boulder(科罗拉多大学波德分校)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于神经符号框架的视觉-语言物流代理,通过自然语言对话和可验证保证实现可信赖的物流规划决策,模型在少量训练样本下实现了高效且准确的物流规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08140 2026-02-02 cs.AI cs.FL cs.LG 79%

Lost in Transmission: When and Why LLMs Fail to Reason Globally

在传输中迷失:当且为什么大语言模型无法全球推理

Tobias Schnabel, Kiran Tomlinson, Adith Swaminathan, Jennifer Neville

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究指出大语言模型在处理需要高带宽通信的任务时存在能力限制,并通过BAPO模型证明了链式思维能将复杂问题简化为易处理形式。

Comments 39 pages; NeurIPS 2025, spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23085 2026-02-02 cs.IR cs.AI 77%

OrLog: Resolving Complex Queries with LLMs and Probabilistic Reasoning

OrLog:利用LLM和概率推理解决复杂查询

Mohanna Hoveyda, Jelle Piepenbrock, Arjen P de Vries, Maarten de Rijke, Faegheh Hasibi

机构 * Radboud University(拉德堡德大学) Eindhoven University of Technology(埃因霍温理工大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OrLog通过结合LLM和概率推理,实现约束感知的高效检索,提升查询精度并减少token消耗。

Comments Accepted to ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23066 2026-02-02 cs.SD cs.AI 77%

Towards Explicit Acoustic Evidence Perception in Audio LLMs for Speech Deepfake Detection

向音频大语言模型中引入显式听觉证据感知以实现语音深度伪造检测

Xiaoxuan Guo, Yuankun Xie, Haonan Cheng, Jiayi Zhou, Jian Liu, Hengyan Huang, Long Ye, Qin Zhang

机构 * State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室) Communication University of China(中国传媒大学) Machine Intelligence(人工智能) Key Laboratory of Media Audio & Video, Ministry of Education, Communication University of China(教育部媒体音频视频重点实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SDD-APALLM框架,通过结合原始音频与结构化频谱图,增强音频LLM对细粒度声学特征的感知能力,提升语音深度伪造检测的准确性和鲁棒性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22329 2026-02-02 cs.AI cs.CY 77%

Sparks of Rationality: Do Reasoning LLMs Align with Human Judgment and Choice?

理性之光:推理大语言模型是否与人类判断和选择一致?

Ala N. Tak, Amin Banayeeanzade, Anahita Bolourani, Fatemeh Bahrani, Ashutosh Chaubey, Sai Praneeth Karimireddy, Norbert Schwarz, Jonathan Gratch

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究评估了LLMs在理性选择和情感影响下的表现,发现有意识思考能提升理性,但情感引导方法在可控性与人类行为对齐间存在权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21937 2026-02-02 cs.AI 77%

Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities

检索增强推理沙盒:一种解耦检索与推理能力的基准

Shuangshuang Ying, Zheyu Wang, Yunjian Peng, Jin Chen, Yuhao Wu, Hongbin Lin, Dingyu He, Siyi Liu, Gengchen Yu, YinZhu Piao, Yuchen Wu, Xin Gui, Zhongyuan Peng, Xin Li, Xeron Du, Libo Qin, YiXin Cao, Ge Zhang, Stephen Huang

机构 * Full author list in Contributions(完整作者列表)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 DeR2通过解耦检索与推理能力,提供了一种评估大语言模型处理新颖科学信息能力的基准测试方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11391 2026-02-02 cs.LG 77%

Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization

通过空域约束策略优化缓解安全对齐税

Yifan Niu, Han Xiao, Dongyi Liu, Nuo Chen, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过空域约束策略优化缓解安全对齐税,提出NSPO框架在保留LLM核心能力的同时提升安全性能。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00459 2026-02-02 cs.AI 77%

Thinking Machines: Mathematical Reasoning in the Age of LLMs

思考机器:在大语言模型时代中的数学推理

Andrea Asperti, Alberto Naibo, Claudio Sacerdoti Coen

机构 * Department of Informatics--- Science and Engineering (DISI), University of Bologna(信息科学与工程系(DISI),博洛尼亚大学) Department of Philosophy, University Paris 1 Panthéon-Sorbonne(哲学系,巴黎第一大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在数学推理中的现状,分析了传统数学与形式化数学的差异,以及证明合成与代码生成的对比,旨在明确当前系统的局限性并指出未来发展方向。

Journal ref Big Data and Cognitive Computing, 2026, 10(1), 38

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04575 2026-02-02 cs.CL 77%

Are LLMs Stable Formal Logic Translators in Logical Reasoning Across Linguistically Diversified Texts?

LLMs是否在跨语言多样化文本中的逻辑推理中是稳定的正式逻辑翻译器?

Qingchuan Li, Jiatong Li, Zirui Liu, Mingyue Cheng, Yuting Zeng, Qi Liu, Tongxuan Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SoLT基准测试和MenTaL方法,揭示LLMs在跨语言多样化文本中存在符号映射不一致问题,并通过增强语言多样性提升推理稳定性。

Comments Accepted by WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22208 2026-02-02 cs.SE 75%

Stalled, Biased, and Confused: Uncovering Reasoning Failures in LLMs for Cloud-Based Root Cause Analysis

停滞、偏见和困惑:揭示LLM在基于云的根本原因分析中的推理失败

Evelien Riddell, James Riddell, Gengyi Sun, Michał Antkiewicz, Krzysztof Czarnecki

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过实证评估揭示LLM在基于云的根本原因分析中的推理失败,评估六种LLM在两种工作流程下的表现,识别16种常见推理失败类型,为未来推理驱动的系统诊断提供指导。

Comments FORGE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22930 2026-02-02 cs.RO cs.AI cs.LG 73%

MTDrive: Multi-turn Interactive Reinforcement Learning for Autonomous Driving

MTDrive: 多轮交互式强化学习用于自动驾驶

Xidong Li, Mingyu Guo, Chenchao Xu, Bailin Li, Wenjing Zhu, Yangang Zou, Rui Chen, Zehuan Wang

机构 * Li Auto Inc.(利汽车公司) NVIDIA(英伟达)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MTDrive通过多轮交互式强化学习框架,结合多模态大语言模型与强化学习,提升自动驾驶轨迹规划的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22352 2026-02-02 cs.LG cs.AI 73%

Recoverability Has a Law: The ERR Measure for Tool-Augmented Agents

可恢复性有定律:工具增强智能体的ERR度量

Sri Vatsa Vuddanti, Satwik Kumar Chittiprolu

机构 * Sri Vatsa Vuddanti(独立研究者) Satwik Kumar Chittiprolu(独立研究者)

专题命中 推理与问题求解 :language model(abstract);language agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种预测理论,通过预期恢复遗憾(ERR)与效率分数(ES)的关系,揭示了语言模型智能体在工具使用中的可恢复性遵循可测量的定律。

Comments Preprint for ICML Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23184 2026-02-02 cs.CL 70%

ReGuLaR: Variational Latent Reasoning Guided by Rendered Chain-of-Thought

ReGuLaR: 基于渲染思维链的变分潜在推理

Fanmeng Wang, Haotian Liu, Guojiang Zhao, Hongteng Xu, Zhifeng Gao

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大型模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ReGuLaR通过渲染思维链图像并利用视觉-语义表示正则化后验分布,实现高效的潜在推理,优于现有方法并在多模态推理中超越CoT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23027 2026-02-02 cs.LG 70%

Divide-and-Conquer CoT: RL for Reducing Latency via Parallel Reasoning

分而治之的CoT:通过并行推理减少延迟的强化学习

Arvind Mahankali, Kaiyue Wen, Tengyu Ma

专题命中 推理与问题求解 :LLM(abstract);SFT(abstract);分类 cs.LG

AI总结 通过并行推理和强化学习,DC-CoT在减少延迟的同时保持高精度,适用于数学推理任务。

Comments 47 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22742 2026-02-02 cs.CL 70%

AR-BENCH: Benchmarking Legal Reasoning with Judgment Error Detection, Classification and Correction

AR-BENCH:通过判决错误检测、分类和纠正进行法律推理基准测试

Yifei Li, Richong Zhang, Wanyu Tu, Zhijie Nie, Haokun Luo, Chuantao Yin, Pengchong Li

机构 * SKLCCSE Beihang University(北京航空航天大学软件学院) SCCE University of Science and Technology Beijing(北京科技大学计算机学院) Sino-French Engineer School Beihang University(北京航空航天大学中法工程师学院) People’s Procuratorate of Beijing Municipality(北京市人民检察院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AR-BENCH通过构建基准数据集和评估14个大语言模型,揭示现有模型在法律判决错误识别上的局限性,旨在提升法律推理的诊断能力和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22735 2026-02-02 cs.CL 70%

MM-THEBench: Do Reasoning MLLMs Think Reasonably?

MM-THEBench: 多模态大语言模型是否能合理推理?

Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

机构 * KIRC, Institute for Artificial Intelligence, Tsinghua University, China(KIRC人工智能研究院,清华大学,中国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MM-THEBench旨在评估推理MLLMs在中间推理过程中的幻觉问题,通过细粒度分类和多层次评估框架,揭示思考对多模态任务中幻觉和推理能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13926 2026-02-02 cs.CL 70%

BioMedSearch: A Multi-Source Biomedical Retrieval Framework Based on LLMs

BioMedSearch: 基于LLMs的多源生物医学检索框架

Congying Liu, Xingyuan Wei, Peipei Liu, Yiqing Shen, Yanxu Mao, Tiehan Cui

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Johns Hopkins University(约翰霍普金斯大学) Henan University(河南大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 BioMedSearch基于LLMs构建多源生物医学检索框架,通过整合文献、蛋白质数据库和网络搜索,提升复杂生物医学问题的准确回答能力。

Journal ref Proceedings of the IEEE International Conference on Bioinformatics and Biomedicine (BIBM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19439 2026-02-02 cs.CL 70%

Surrogate Signals from Format and Length: Reinforcement Learning for Solving Mathematical Problems without Ground Truth Answers

从格式和长度获取代理信号:用于无真实答案解决数学问题的强化学习

Rihui Xin, Han Liu, Zecheng Wang, Yupeng Zhang, Dianbo Sui, Xiaolin Hu, Bingning Wang

机构 * Baichuan Inc(百川公司) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出利用格式和长度作为代理信号,通过强化学习提升数学问题解决性能,无需真实答案,实现高效推理优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22536 2026-02-02 cs.AI 70%

Decoding in Geometry: Alleviating Embedding-Space Crowding for Complex Reasoning

解码中的几何学:缓解嵌入空间拥挤以促进复杂推理

Yixin Yang, Qingxiu Dong, Zhifang Sui

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CraEG方法,通过几何引导重新加权缓解嵌入空间拥挤,提升大语言模型在数学问题解决中的推理能力和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11062 2026-02-02 cs.LG cs.MA 70%

Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs

Stronger-MAS: 多智能体强化学习用于协作大语言模型

Yujie Zhao, Lanxiang Hu, Yang Wang, Minmin Hou, Hao Zhang, Ke Ding, Jishen Zhao

机构 * University of California, San Diego(加州大学圣地亚哥分校) Intel Corporation(英特尔公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Stronger-MAS提出了一种针对多智能体强化学习的AT-GRPO算法,通过改进的分组策略和训练系统,在多个任务中显著提升了大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12657 2026-02-02 cs.CL 70%

Synthetic Socratic Debates: Examining Persona Effects on Moral Decision and Persuasion Dynamics

合成苏格拉底辩论:考察人格对道德决策与说服动态的影响

Jiarui Liu, Yueqi Song, Yunze Xiao, Mingqian Zheng, Lindia Tjuatja, Jana Schaich Borg, Mona Diab, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学) Duke University(杜克大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过模拟AI-AI辩论研究人格对道德决策和说服效果的影响,发现政治意识形态和性格特质对辩论结果影响最大,且随着辩论进行,论证趋于温和。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22889 2026-02-02 cs.CL cs.AI cs.LG cs.SD 67%

DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion

DiffuSpeech: 通过统一的语音-文本扩散实现无声思考, spoken 答案

Yuxuan Lou, Ziming Wu, Yaochen Wang, Yong Liu, Yingxuan Ren, Fuming Lai, Shaobing Lian, Jie Tang, Yang You

机构 * National University of Singapore(新加坡国立大学) Tencent(腾讯)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DiffuSpeech通过统一的语音-文本扩散模型,实现语音生成的同时生成内部推理,提升语音问答的准确性和语音质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22483 2026-02-02 cs.CV 67%

Head-Aware Visual Cropping: Enhancing Fine-Grained VQA with Attention-Guided Subimage

头感知视觉裁剪:通过注意力引导的子图像增强细粒度VQA

Junfei Xie, Peng Pan, Xulong Zhang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 通过注意力引导的子图像增强细粒度VQA,提出无需训练的HAVC方法,利用优化的注意力头提升视觉定位精度。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20835 2026-02-02 cs.CV cs.AI 57%

Open-Vocabulary Functional 3D Human-Scene Interaction Generation

开放词汇功能3D人类-场景交互生成

Jie Liu, Yu Sun, Alpar Cseke, Yao Feng, Nicolas Heron, Michael J. Black, Yan Zhang

机构 * Meshcapade University of Amsterdam(阿姆斯特丹大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 FunHSI通过功能驱动框架生成开放词汇任务下的功能正确3D人类-场景交互。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22647 2026-02-02 cs.AI 57%

Test-Time Mixture of World Models for Embodied Agents in Dynamic Environments

动态环境中具身智能体的测试时间世界模型混合

Jinwoo Jang, Minjong Yoo, Sihyung Yoon, Honguk Woo

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Sungkyunkwan University(庆尚大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 TMoW通过测试时间更新路由函数,提升具身智能体在动态环境中的适应性与持续学习能力。

Comments Accepted at ICLR 2026. 10 pages. Code available at https://github.com/doldam0/tmow

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22376 2026-02-02 cs.CV 50%

FlexMap: Generalized HD Map Construction from Flexible Camera Configurations

FlexMap:从灵活的相机配置构建通用HD地图

Run Wang, Chaoyi Zhou, Amir Salarpour, Xi Liu, Zhi-Qi Cheng, Feng Luo, Mert D. Pesé, Siyu Huang

机构 * School of Computing, Clemson University School of Engineering \& Technology, University of Washington

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 FlexMap通过几何感知基础模型和跨帧注意力机制,实现从灵活相机配置构建通用HD地图,提升了自动驾驶系统在传感器失效和配置变化时的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15336 2026-02-02 cs.RO cs.SY eess.SY 50%

Adaptive Cost-Map-based Path Planning in Partially Unknown Environments with Movable Obstacles

在部分未知环境中基于自适应成本图的路径规划

Liviu-Mihai Stan, Ranulfo Bezerra, Shotaro Kojima, Tsige Tadesse Alemayoh, Satoshi Tadokoro, Masashi Konyo, Kazunori Ohno

机构 * Graduate School of Information Sciences, Tohoku University(东京大学信息科学研究生院) Tough Cyberphysical AI Research Center, Tohoku University(东京大学 Tough 联合人工智能研究中心) Sorbonne University(索邦大学)

专题命中 推理与问题求解 :prompting(abstract)

AI总结 本文提出了一种自适应成本图路径规划方法,通过识别可移动障碍物提升机器人在非结构化环境中的导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15612 2026-02-02 cs.SD eess.AS 50%

Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition

在鸡尾酒派对中思考:用于目标说话人自动语音识别的链式思维和强化学习

Yiru Zhang, Hang Su, Lichun Fan, Zhenbo Luo, Jian Luan

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) MiLM Plus, Xiaomi Inc., China(MiLM Plus,小米公司,中国)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出结合链式思维和强化学习的新型框架,提升目标说话人自动语音识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 43 篇

2507.22911 2026-02-02 cs.CL cs.AI 90%

ElectriQ: A Benchmark for Assessing the Response Capability of Large Language Models in Power Marketing

ElectriQ:一个评估大型语言模型在电力营销中响应能力的基准

Jinzhi Wang, Qingke Peng, Haozhou Li, Zeyuan Zeng, Jiangbo Zhang, Kaixuan Yang, Ningyong Wu, Qinfeng Song, Ruimeng Li, Biyi Zhou

机构 * Systems Engineering Institute, Xi’an Jiaotong University(系统工程研究所,西安交通大学) State Key Laboratory of Multiphase Flow in Power Engineering, School of Energy and Power Engineering, Xi’an Jiaotong University(电力工程多相流国家重点实验室,能源与动力工程学院,西安交通大学) School of Electronic Science and Engineering, Xi'an Jiaotong University(电子科学与工程学院,西安交通大学) Organizational Management Department, School of Management, Xi’an Jiaotong University(组织管理部,管理学院,西安交通大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 ElectriQ是一个用于评估大型语言模型在电力营销中响应能力的基准,通过结合人类评分、自动指标和合规测试,提出SEEK-RAG方法提升领域知识注入,实现高效且合规的电力营销助手部署。

详情

展开后加载摘要…

URL PDF HTML 收藏