arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-21 至 2026-01-21 共收录 543 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 15 篇

2601.10599 2026-01-21 cs.CY 50%

Institutional AI: A Governance Framework for Distributional AGI Safety

机构AI:分布式AGI安全的治理框架

Federico Pierucci, Marcello Galisai, Marcantonio Syrnikov Bracale, Matteo Prandi, Piercosma Bisconti, Francesco Giarrusso, Olga Sorokoletova, Vincenzo Suriani, Daniele Nardi

专题命中 后训练与偏好优化 :LLM(abstract)

AI总结 机构AI通过治理框架解决分布式AGI安全问题,将对齐视为治理机制设计问题,通过运行时监控、激励塑造和规范执行来约束代理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 11 篇

2601.13734 2026-01-21 cs.CL cs.AI 91%

Towards robust long-context understanding of large language model via active recap learning

通过主动回顾学习实现大语言模型长上下文理解的鲁棒性

Chenyu Hui

机构 * School of Microelectronics(微电子学院) Xi'an Jiaotong University(西安交通大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 本文提出主动回顾学习方法,通过生成和利用回顾性总结提升大语言模型对长上下文的理解能力,在RULER和LongBench上分别取得26.8%和9.44%的提升。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13352 2026-01-21 cs.CL cs.AI cs.MA 90%

LLM-as-RNN: A Recurrent Language Model for Memory Updates and Sequence Prediction

LLM-as-RNN: 一种用于内存更新和序列预测的循环语言模型

Yuxing Lu, J. Ben Tamo, Weichen Zhao, Nan Sun, Yishan Zhong, Wenqi Shi, Jinzhuo Wang, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Peking University(北京大学) Shandong University(山东大学) Huazhong University of Science and Technology(华中科技大学) UT Southwestern Medical Center(西南医学中心)

专题命中 长上下文与记忆 :LLM(title,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 LLM-as-RNN通过将冻结的LLM转化为循环预测器,利用自然语言记忆实现在线学习,有效提升序列预测精度并生成可解释的学习轨迹。

Comments 17 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13476 2026-01-21 cs.LG cs.AI 84%

A Unified Variational Imputation Framework for Electric Vehicle Charging Data Using Retrieval-Augmented Language Model

基于检索增强语言模型的统一变分填补框架用于电动汽车充电数据

Jinhao Li, Hao Wang

机构 * Department of Data Science and AI, Faculty of IT and Monash Energy Institute, Monash University(数据科学与人工智能系,信息科技学院和莫纳什能源研究所,莫纳什大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PRAIM框架,利用检索增强语言模型和变分神经架构,提升电动汽车充电数据填补的准确性和统计分布保留能力,从而提高预测性能。

Comments 15 pages

Journal ref IEEE Transactions on Smart Grid, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11564 2026-01-21 cs.CL cs.AI 84%

Context Discipline and Performance Correlation: Analyzing LLM Performance and Quality Degradation Under Varying Context Lengths

上下文学科与性能相关性:分析在不同上下文长度下LLM性能及质量退化

Ahilan Ayyachamy Nadar Ponnusamy, Karthic Chandran, M Maruf Hossain

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了不同上下文长度下LLM性能与质量退化的关系,发现KV缓存增长导致性能非线性退化,并揭示了MoE架构在高token体积时受基础设施瓶颈影响的问题。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13631 2026-01-21 cs.OS cs.DC 82%

ContiguousKV: Accelerating LLM Prefill with Granularity-Aligned KV Cache Management

ContiguousKV: 通过粒度对齐的KV缓存管理加速LLM预填

Jing Zou, Shangyu Wu, Hancong Duan, Qiao Li, Chun Jason Xue

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract)

AI总结 ContiguousKV通过粒度对齐的KV缓存管理,提升LLM预填效率,实现3.85倍加速并保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15364 2026-01-21 cs.AI 79%

KeyDiff: Key Similarity-Based KV Cache Eviction for Long-Context LLM Inference in Resource-Constrained Environments

KeyDiff: 基于键相似性的KV缓存淘汰方法用于资源受限环境中的长上下文LLM推理

Junyoung Park, Dalton Jones, Matthew J Morse, Raghavv Goel, Mingu Lee, Chris Lott

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 KeyDiff是一种基于键相似性的KV缓存淘汰方法,能够在资源受限环境下高效处理长上下文LLM推理,减少缓存占用并提升响应效率。

Comments 37 pages, 19 figures, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11762 2026-01-21 cs.CL cs.AI cs.LG 75%

Industry-Aligned Granular Topic Modeling

面向行业的细粒度主题建模

Sae Young Moon, Myeongjun Erik Jang, Haoyan Luo, Chunyang Xiao, Antonios Georgiadis, Fran Silavong

机构 * J.P. Morgan Chase(摩根大通)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TIDE框架,基于大语言模型实现细粒度主题建模,并提供业务应用支持功能,实验表明其在工业场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12906 2026-01-21 cs.CL 74%

Gated Differentiable Working Memory for Long-Context Language Modeling

具有门控可微工作记忆的长上下文语言模型

Lingrui Mei, Shenghua Liu, Yiwei Wang, Yuyao Ge, Baolong Bi, Jiayu Yao, Jun Wan, Ziling Yin, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) University of California, Merced(加州大学梅尔塞德斯分校) UBS AG(UBS集团)

专题命中 长上下文与记忆 :language model(title);分类 cs.CL

AI总结 Gdwm通过门控可微工作记忆框架,在有限计算下优化长上下文语言模型的测试时间适应,提升效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13722 2026-01-21 cs.CL cs.AI 73%

OP-Bench: Benchmarking Over-Personalization for Memory-Augmented Personalized Conversational Agents

OP-Bench:用于内存增强个性化对话代理的过个性化基准测试

Yulin Hu, Zimo Long, Jiahe Guo, Xingyu Sui, Xing Fu, Weixiang Zhao, Yanyan Zhao, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 OP-Bench通过评估多种模型和方法,揭示了内存增强对话代理中过个性化问题的普遍性,并提出Self-ReCheck机制以缓解该问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12030 2026-01-21 cs.AI 70%

ARC: Active and Reflection-driven Context Management for Long-Horizon Information Seeking Agents

ARC:面向长周期信息检索代理的主动与反思驱动上下文管理

Yilun Yao, Shan Huang, Elsie Dai, Zhewen Tan, Zhenyu Duan, Shousheng Jia, Yanbing Jiang, Tong Yang

机构 * Peking University(北京大学) Beihang University(北京航空航天大学) Qiyuan Tech(启元科技)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ARC 通过主动和反思驱动的上下文管理方法,提升了长周期信息检索代理的性能,显著提高了准确性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13614 2026-01-21 cs.CL cs.AI cs.LG 67%

CauScientist: Teaching LLMs to Respect Data for Causal Discovery

CauScientist: 教授大语言模型尊重数据进行因果发现

Bo Peng, Sirui Chen, Lei Xu, Chaochao Lu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Tongji University(同济大学) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CauScientist通过结合大语言模型与概率统计,提升因果发现的准确性与可靠性,实现显著的F1分数提升和召回率提高。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 94 篇

2508.17281 2026-01-21 cs.CL 90%

From Language to Action: A Review of Large Language Models as Autonomous Agents and Tool Users

从语言到行动:大型语言模型作为自主代理和工具使用者的综述

Sadia Sultana Chowa, Riasad Alvi, Subhey Sadi Rahman, Md Abdur Rahman, Mohaimenul Azam Khan Raiaan, Md Rafiqul Islam, Mukhtar Hussain, Sami Azam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Faculty of Science and Technology(科学与技术学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文综述了大型语言模型作为自主代理和工具使用者的发展,探讨了其架构设计、认知机制及未来研究方向。

Comments Submitted to Artificial Intelligence Review for peer review

Journal ref Artif. Intell. Rev. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12538 2026-01-21 cs.AI cs.CL 90%

Agentic Reasoning for Large Language Models

大语言模型的代理推理

Tianxin Wei, Ting-Wei Li, Zhining Liu, Xuying Ning, Ze Yang, Jiaru Zou, Zhichen Zeng, Ruizhong Qiu, Xiao Lin, Dongqi Fu, Zihao Li, Mengting Ai, Duo Zhou, Wenxuan Bao, Yunzhe Li, Gaotang Li, Cheng Qian, Yu Wang, Xiangru Tang, Yin Xiao, Liri Fang, Hui Liu, Xianfeng Tang, Yuji Zhang, Chi Wang, Jiaxuan You, Heng Ji, Hanghang Tong, Jingrui He

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型在开放和动态环境中的代理推理方法,通过三个层次的框架提升单体、自我进化和集体多代理推理能力,并提出了未来研究方向。

Comments Project: https://github.com/weitianxin/Awesome-Agentic-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13892 2026-01-21 cs.LG 89%

Multi-Objective Hierarchical Optimization with Large Language Models

多目标分层优化与大语言模型

Andrej Schwanke, Lyubomir Ivanov, David Salinas, Frank Hutter, Arber Zela

机构 * University of Freiburg(弗赖堡大学) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出利用大语言模型作为替代模型和候选采样器,结合结构化分层搜索策略,实现多目标优化,实验表明其在多个基准上表现优异。

Comments 23 pages, 21 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13630 2026-01-21 cs.CL 89%

Activation-Space Anchored Access Control for Multi-Class Permission Reasoning in Large Language Models

基于激活空间锚定的多类权限推理访问控制

Zhaopeng Zhang, Pengcheng Sun, Lan Zhang, Chen Tang, Jiewei Lai, Yunhao Wang, Hui Jin

机构 * University of Science and Technology of China(中国科学技术大学) Lenovo Research(联想研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出AAAC框架,通过激活空间锚点实现多类权限控制,有效降低权限违规和攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15089 2026-01-21 cs.AI 89%

Beyond Fast and Slow: Cognitive-Inspired Elastic Reasoning for Large Language Models

超越快速与缓慢:面向大语言模型的认知启发弹性推理

Jinwu Hu, Dongjin Yang, Langyu Bian, Zhiquan Wen, Yufeng Wang, Yaofo Chen, Bin Xiao, Yuanqing Li, Mingkui Tan

机构 * South China University of Technology(南方科技大学) Pazhou Laboratory(琶洲实验室) Peng Cheng Laboratory(鹏城实验室) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出CogER框架,通过动态选择推理策略提升大语言模型在不同难度查询中的推理效率与准确性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12444 2026-01-21 cs.AI cs.LO 89%

Large Language Model for OWL Proofs

面向OWL证明的大型语言模型

Hui Yang, Jiaoyan Chen, Uli Sattler

机构 * The University of Manchester(曼彻斯特大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出面向OWL本体论证明生成的LLM方法,通过构建评估框架验证了逻辑复杂性对LLM性能的影响,并发现输入数据质量对证明生成至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13387 2026-01-21 cs.CL cs.LG 88%

Confidence over Time: Confidence Calibration with Temporal Logic for Large Language Model Reasoning

时间上的信心:基于时序逻辑的大型语言模型推理信心校准

Zhenjiang Mao, Anirudhh Venkat, Artem Bisliouk, Akshat Kothiyal, Sindhura Kumbakonam Subramanian, Saithej Singhu, Ivan Ruchkin

机构 * University of Florida(佛罗里达大学) University of Mannheim(曼海姆大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于时序逻辑的大型语言模型推理信心校准方法,通过STL挖掘和参数超网络提升信心评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11686 2026-01-21 cs.LG cs.AI 88%

Proof of Concept: Multi-Target Wildfire Risk Prediction and Large Language Model Synthesis

概念验证:多目标野火风险预测与大语言模型合成

Nicolas Caron, Christophe Guyeux, Hassan Noura, Benjamin Aynes

机构 * Université Marie et Louis Pasteur(玛丽-路易斯·帕斯特大学) CNRS(国家科学研究中心) FEMTO-ST(弗尔米约-圣特研究中心) SAD Marketing(SAD营销)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合框架,结合多目标预测模型与大语言模型,以生成结构化的野火风险评估报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11622 2026-01-21 cs.AI cs.LG 88%

Dynamical Systems Analysis Reveals Functional Regimes in Large Language Models

动力系统分析揭示大语言模型中的功能模式

Hassan Ugail, Newton Howard

机构 * Centre for Visual Computing and Intelligent Systems(视觉计算与智能系统中心) University of Bradford(布拉德福德大学) School of Individualised Study(个性化学习学院) Rochester Institute of Technology(罗切斯特技术学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过动力系统分析揭示大语言模型在不同功能模式中的计算组织差异,提出一种基于时间序列的动态度量指标,用于评估模型内部动态特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01562 2026-01-21 cs.AI 88%

Logics-STEM: Empowering LLM Reasoning via Failure-Driven Post-Training and Document Knowledge Enhancement

Logics-STEM: 通过故障驱动的微调和文档知识增强赋能大语言模型推理

Mingyu Xu, Cheng Fang, Keyue Jiang, Yuqian Zheng, Yanghua Xiao, Baojian Zhou, Qifang Zhao, Suhang Zheng, Xiuwen Zhu, Jiyang Tang, Yongchi Zhao, Yijia Luo, Zhiqi Bai, Yuchi Xu, Wenbo Su, Wei Wang, Bing Zhao, Lin Qu, Xiaoxiao Xu

机构 * Alibaba Group(阿里巴巴集团) Shanghai Key Laboratory of Data Science, Fudan University(上海数据科学国家重点实验室,复旦大学) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 推理与问题求解 :post-training(title,abstract);LLM(title);SFT(abstract);分类 cs.AI

AI总结 Logics-STEM通过故障驱动微调和文档知识增强,提升大语言模型在STEM领域的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12995 2026-01-21 cs.CL 88%

Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language Models

图推理范式:基于拓扑感知强化学习的结构化和符号推理用于大语言模型

Runxuan Liu, Xianhao Ou, Xinyan Ma, Jiyuan Wang, Jiafeng Liang, Jiaqi Li, Tao He, Zheng Chu, Rongchuan Mu, Zekun Wang, Baoxin Wang, Dayong Wu, Ming Liu, Shijin Wang, Guoping Hu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Tianjin Normal University(天津师范大学) Pengcheng Laboratory(鹏城实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 图推理范式通过拓扑感知强化学习实现结构化和符号推理,提升大语言模型的数学推理和代码生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01652 2026-01-21 cs.CL 88%

MIRAGE: Exploring How Large Language Models Perform in Complex Social Interactive Environments

MIRAGE:探索大型语言模型在复杂社会互动环境中的表现

Yin Cai, Zhouhong Gu, Zhaohan Du, Zheyu Ye, Shaosheng Cao, Yiqian Xu, Hongwei Feng, Ping Chen

机构 * Institute of Big Data, Fudan University(复旦大学大数据研究院) Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(复旦大学计算机学院) School of Computer Science, Fudan University(复旦大学计算机学院) Xiaohongshu Inc.(小红书公司)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MIRAGE通过谋杀谜案游戏评估LLMs在复杂社会互动环境中的表现,揭示其在信任、线索调查、互动和指令遵循方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14052 2026-01-21 cs.CV 88%

Vision Also You Need: Navigating Out-of-Distribution Detection with Multimodal Large Language Model

视觉也需要:利用多模态大语言模型进行分布外检测导航

Haoran Xu, Yanlin Liu, Zizhao Tong, Jiaze Li, Kexue Fu, Yuyang Zhang, Longxiang Gao, Shuaiguang Li, Xingyu Li, Yanran Xu, Changwei Wang

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算电力网络与信息安全重点实验室,山东计算机科学中心(国家超算中心济南中心),齐鲁工业大学(山东科学院)) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算电力互联网与服务计算重点实验室,山东省计算机科学基础研究中心) University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) RWTH Aachen University(亚琛工业大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出MM-OOD方法,利用多模态大语言模型的推理能力,通过多轮对话增强分布外检测,提升近远OOD任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12274 2026-01-21 cs.SE 88%

Hybrid Concolic Testing with Large Language Models for Guided Path Exploration

基于大语言模型的混合协同测试用于引导路径探索

Mahdi Eslamimehr

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出一种结合大语言模型与协同执行的混合测试方法,通过引导路径探索提升程序状态空间探索效率和缺陷检测能力。

Comments 12 pages, 2 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14209 2026-01-21 cs.LG cs.AI cs.CL 87%

InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning

InT:自我提出干预使LLM推理中的信用分配成为可能

Matthew Y. R. Yang, Hao Bai, Ian Wu, Gene Yang, Amrith Setlur, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 InT通过自我提出干预实现LLM推理中的细粒度信用分配,提升模型在数学推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13392 2026-01-21 cs.CL cs.AI cs.FL 86%

Beyond Memorization: Testing LLM Reasoning on Unseen Theory of Computation Tasks

超越记忆:在未见的计算理论任务上测试LLM推理能力

Shlok Shelat, Jay Raval, Souvik Roy, Manas Gaur

机构 * Ahmedabad University Gujarat, India(古吉拉特邦阿赫迈德亚布大学) University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过构建DFA基准测试,揭示LLM在未见计算理论任务上的推理缺陷,发现其在处理复杂约束和语义一致性时存在系统性不足。

Comments 30 pages, 11 figures, 6 tables, Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11905 2026-01-21 cs.AI cs.LG math.ST stat.TH 86%

LIBRA: Language Model Informed Bandit Recourse Algorithm for Personalized Treatment Planning

LIBRA:基于语言模型的带状 recourse 算法用于个性化治疗计划

Junyu Cao, Ruijiang Gao, Esmaeil Keyvanshokooh, Jianhao Ma

机构 * McCombs School of Business, University of Texas at Austin(德克萨斯大学奥斯汀分校麦克斯韦商学院) Naveen Jindal School of Management, University of Texas at Dallas(德克萨斯大学达拉斯分校奈文·金达管理学院) Mays Business School, Texas A&M University(德克萨斯农工大学梅斯商学院) Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 LIBRA 是一种结合大语言模型和带状学习的算法,用于在个性化治疗中实现更高效的决策和鲁棒性。

Comments 50 pages. Previous version with human-AI collaboration: arXiv:2410.14640

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13206 2026-01-21 cs.AI 85%

Real-Time Deadlines Reveal Temporal Awareness Failures in LLM Strategic Dialogues

实时截止时间揭示了LLM战略对话中的时间意识失败

Neil K. R. Sehgal, Sharath Chandra Guntuku, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现LLM在时间敏感任务中存在时间跟踪不足的问题,导致在实时截止条件下表现不佳,但能在回合制限制下表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏