arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1799 篇

2608.22194 2026-08-25 physics.soc-ph 新提交 90%

From Authorial Mathematics to Studio Mathematics:Ecobiontic Forms of Proof after Large Language Models

从作者式数学到工作室式数学:大型语言模型之后的证明的生态生物形式

Oliver López Corona

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文探讨大型语言模型等技术催生的人机集合体(工作室生态生物)的认识合法性,提出需满足可追溯来源等治理条件,通过案例分析明确协作等维度的独立性,未声称其优于传统作者式数学实践。

Comments 43 pages, 6 figures; includes supplementary methodological and validation material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14927 2026-08-18 cs.AI cs.CL cs.LG 新提交 90%

LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks

大语言模型(LLM)可预测失败风险,但难以预测哪种协作协议能产生回报:推理任务中考虑成本的协议路由

Chih-Hsuan Yang, Jingyan Jiang, Cheng-Hau Yang, Vikram Vasudevan, Huihuo Zheng, Venkatram Vishwanath, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) Oregon State University(俄勒冈州立大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨LLM多智能体系统中协作成本与收益的平衡,测试四种协作协议,发现LLM可预测失败风险但难以识别有效协议,置信度可支持初始协作升级,特定协议的成本感知路由仍待解决。

Comments 23 pages, 6 figures; includes appendices and ancillary aggregate-result CSV files

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22082 2026-07-27 cs.MA 新提交 90%

When Language Models Meet NeuroGraphs: Exploring Enhanced Agentic LLM Framework Towards Brain Network Analysis

当语言模型遇上神经图谱:探索用于脑网络分析的增强型智能语言模型框架

Jiaxing Li, Rui Dong, Muyao Tang, Youyong Kong

专题命中 推理与问题求解 :LLM(title,abstract);language model(title,abstract);large language model(abstract);prompting(abstract)

AI总结 研究针对脑网络分析中现有方法解释性有限等问题,提出BrainAgent智能语言模型框架,将连接组分类设为迭代过程,经特定工具转换、知识检索等步骤生成结构化预测,实验证明其优于基线,为脑网络分析提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00260 2026-07-03 eess.AS 新提交 90%

Do Multimodal Large Language Models Need Reasoning to Classify Dementia from Speech?

多模态大语言模型是否需要推理来从语音中分类痴呆症?

Liming Wang, Neguine Rezaii, Bradford C. Dickerson, James Glass

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文评估了多模态大语言模型在自动痴呆症分类中的推理能力,发现基于文本理由的策略会导致幻觉和不一致,并提出DeTAiL框架,通过非线性适配器和强化学习利用内部表示,在两个数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27731 2026-06-29 cs.CL cs.AI cs.CE cs.LG 新提交 90%

Enhancing Numerical Prediction in LLMs via Smooth MMD Alignment

通过平滑MMD对齐增强LLM中的数值预测

Zhuo Zuo, Li Yue, Wenhao Zheng, Chenpeng Wang, Xianggen Liu

机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院,成都,中国)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM在数值预测任务中精度不足的问题,提出平滑最大均值差异(SMMD)方法,通过数值令牌的距离核和图平滑对齐预测分布,在数学推理等任务中显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20607 2026-06-23 cs.HC 新提交 90%

LLM4CAD-Editor: An Intent-Aware Large Language Model Framework for Multi-Level Computer-Aided Design Editing

LLM4CAD-Editor:一种面向多层级计算机辅助设计编辑的意图感知大语言模型框架

Yuewan Sun, Zhenghui Sha

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出LLM4CAD-Editor框架,通过结构化领域特定语言LLM4CAD-DSL实现自然语言驱动的CAD编辑,支持功能、操作和参数三级编辑,在参数级编辑上达到96.3%解析准确率和0.935 IoU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26990 2026-08-28 cs.AI cs.MA 新提交 90%

DSA: Evidence-Aware LLM-Agent Orchestration for Multi-Market Stock Research

DSA:面向多市场股票研究的证据感知大语言模型智能体编排框架

Linsen Zhu, Yi Shi

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出DSA框架,基于LLM智能体实现多市场股票研究的证据感知编排,通过工作流组织、配置文件差异化处理及测试验证,确保系统实现一致性。

Comments 6 pages, 2 figures, 3 tables. Code available at https://github.com/ZhuLinsen/daily_stock_analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26332 2026-08-28 cs.LG 新提交 90%

Beyond Capability Benchmarks: Learning Operational Fingerprints of LLM Cloud Services from Production Incident Metadata

超越能力基准:从生产事件元数据学习LLM云服务的操作指纹

Meiwei Zhang, Eduardo Miranda, Bruce Baynes, Suvigya Jain, Wanlong Chen, Tao He, Sergey Borodavkin

机构 * Google Cloud Platform, Google LLC(谷歌云平台,谷歌有限责任公司)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 该研究提出OpEmbed框架,利用生产支持案例元数据学习LLM云服务的操作指纹,在Google Cloud的大规模生产案例评估中表现优异,可用于模型上线、支持评估等场景。

Journal ref ISSRE 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26166 2026-08-28 cs.HC cs.AI 新提交 90%

Improving LLM Interpretability with User-Centric Chain-of-Thought Reasoning

以用户为中心的思维链推理提升大语言模型可解释性

Philipp Schröppel

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出以人为本的LLM推理轨迹构建方法,采用类XML标签编码,在保持数学推理性能的同时提升可解释性,显著改善用户感知的有用性与易用性,助力高风险AI部署的人机协作。

Journal ref Proceedings of the 59th Hawaii International Conference on System Sciences (pp. 1435-1444). University of Hawai'i at Manoa, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25039 2026-08-27 cs.AI 新提交 90%

LifePlanner: Evaluating LLM Agents for Geo-spatial Planning with Social Media Data

LifePlanner:利用社交媒体数据评估LLM智能体的地理空间规划能力

Zhen Dong, Yuning Peng, Yutao Shi, Lei Zhong, Yongsen Mao, Yuan Liu, Haiping Wang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究推出LifePlanner基准测试,结合社交媒体数据评估LLM智能体的地理空间规划能力,发现前沿LLM在简单检索中表现好但复杂规划通过率仅40.2%,失败源于证据获取、工具使用及约束整合问题,需改进实际规划能力而非单纯扩大模型规模。

Comments 25 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24889 2026-08-27 cs.AI 新提交 90%

Reliable LLM-Powered Decision Engines for Large-Scale Supply Chain Operations: Architecture, Safety, and Performance Guarantees

面向大规模供应链运营的可靠大语言模型驱动决策引擎:架构、安全性与性能保证

Nirmal Kumar Jingar

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大规模供应链的不确定性等挑战,提出结合LLM与优化等的LLM-DE架构,实现更智能、安全、可扩展的供应链决策,为下一代智能供应链提供基础。

Journal ref IC_ASET 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23644 2026-08-26 cs.AI 新提交 90%

Ethical LLM-Assisted Research: A Framework for Responsible Delegation, Verification, and Epistemic Value

伦理大语言模型辅助研究:负责任委托、验证与认知价值框架

Kalin Stoyanov

机构 * University of Chemical Technology and Metallurgy(化工技术与冶金大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文构建了伦理LLM辅助研究的规范性框架,明确其伦理边界由充分验证与可问责人类所有权决定,提出认知审计概念以实现AI辅助推理的透明可审查性。

Comments This is a substantially revised version of submit/7664457. I have extensively revised the manuscript to clarify its scholarly contribution, strengthen the formal framework and literature grounding, and remove or reformulate claims that were not sufficiently supported

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23061 2026-08-25 cs.AI 新提交 90%

Improving O-RADS Risk Stratification from Ultrasound Reports: A Comparative Evaluation of Hybrid versus End-to-End LLM Reasoning Strategies

改进超声报告的O-RADS风险分层:混合式与端到端大语言模型推理策略的对比评估

Xiaotong Tan, Chunli Qiu, Xin Liu, Qing Huang, Guangli Zhou, Bo Gao, Xiaoyan Song, Shuyan Wang, Xiuqin Wang, Wufeng Xue, Ruobing Huang, Dong Ni, Guowei Tao, Jun Cheng

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究对比不同LLM推理策略,发现将特征提取与规则分类解耦的混合架构,使用Gemini 3.6 Flash时O-RADS分类准确率达99.2%,优于端到端策略及原始临床报告,可实现准确可靠的自动化临床决策。

Comments Main manuscript: 20 pages, 5 figures, and 2 tables; supplemental material: 11 pages, 1 figure, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22993 2026-08-25 cs.CL cs.HC 新提交 90%

LLM Pedagogical Behavior in AI Tutoring Interactions

AI辅导交互中的LLM教学行为

Suhyeon Lee, Juneha Baek, Jaehyeong Park, Donghyuk Shin

机构 * KAIST(韩国科学技术院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 本研究开发五级支架水平量表,分析大学AI课程中203名学生的14637个LLM辅导响应,发现超95%为高水平帮助,支架水平与学生对话行为相关但对考试表现预测性有限,为LLM辅导提供实证基线与测量框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22566 2026-08-25 cs.CL 新提交 90%

From Diagnosis to Redesign: Using Quantitative Ethnography to Improve Multi-Agent LLM Reasoning

从诊断到重新设计:使用定量人种志改进多智能体大语言模型推理

Vedant Khatri, Anthony Cusimano, Zachari Swiecki, Zhen Xu, Xiner Liu, Renzhe Yu

机构 * University of California, Irvine(加利福尼亚大学欧文分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Monash University(莫纳什大学) Columbia University(哥伦比亚大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出定量人种志方法,以自动作文评分为例,通过分析五智能体辩论系统的交互模式诊断问题并修改提示词,使多智能体LLM的评分准确率从27.78%提升至40.28%。

Comments Accepted at ICQE 2026 (to appear in Springer CCIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22128 2026-08-25 cs.AI 新提交 90%

Task-Driven 3D Printability Assistance via Geometry- and Knowledge-Grounded LLM Reasoning

基于几何与知识基础的大语言模型推理的任务驱动型3D可打印性辅助

Zhaoda Du, Qiaojie Zheng, Xiaoli Zhang

机构 * Colorado School of Mines(科罗拉多矿业学院)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出一种基于几何与知识基础的LLM推理的任务驱动型3D可打印性辅助框架,可生成多维度结构化打印建议,经实验验证其可提升可打印性、任务适用性及材料选择准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21027 2026-08-24 cs.AI 新提交 90%

Don't Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents

无需解决,仅需比较:用于LLM智能体运行时干预的微型顾问

Yanze Jiang, Mingxuan Li, Yuhao Wang, Shengfang Zhai, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究针对LLM智能体运行时干预需求,提出仅比较框架COTA,经多任务多执行器评估,其性能优于基线,可在辅助模型能力弱于执行器时实现有效干预。

Comments 21 pages, 1 figure, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18027 2026-08-19 cs.CL 新提交 90%

Chain-of-Experience for Continual LLM Improvement

用于持续改进大语言模型的经验链(Chain-of-Experience, CoE)

Haoqin Tu, Yunhao Fang, Yizhong Wang, Cihang Xie, Shen Yan

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) Bytedance Seed(字节跳动Seed)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出经验链(CoE)方法,通过迭代交互让LLM从经验中持续改进,在多领域8种LLM上验证其比无反馈基线更优,结合互补反馈可进一步提升,且每令牌准确率高于现有测试时策略。

Comments H.T. and Y.F. contributed to this work equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17443 2026-08-19 cs.AI 新提交 90%

Structure-Internalized Rule Language Model for Faithful Knowledge Graph Reasoning

用于忠实知识图谱推理的结构内化规则语言模型

Xingrui Zhuo, Jiapu Wang, Manzong Huang, Gongqing Wu, Xindong Wu

机构 * Key Laboratory of Knowledge Engineering with Big Data (Hefei University of Technology)(大数据知识工程重点实验室(合肥工业大学)) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息学院) Nanjing University of Science and Technology(南京理工大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract)

AI总结 针对大语言模型在知识图谱推理中存在的推理证据感知漂移问题,提出结构内化规则语言模型SIRLM,通过结构规则生成协调知识与参数化知识,在36个数据集上优于17种现有方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16461 2026-08-18 cs.ET cs.AI cs.CE cs.CY 新提交 90%

A Human-LLM Teaming Framework for Privacy Risk Analysis: An Illustration with CBDC-Based Welfare Schemes

一种用于隐私风险分析的人-大语言模型(LLM)协同框架:以基于央行数字货币(CBDC)的福利方案为例

Sourya Joyee De, Abdessamad Imine

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出用于隐私风险分析的人-LLM协同框架PRIAM,以CBDC福利方案为例验证,该框架通过人机迭代协作优化隐私风险评估,为相关领域提供基础贡献。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14668 2026-08-18 cs.MA cs.AI 新提交 90%

BRA-Audit: Budgeted Runtime Auditing for LLM Multi-Agent Systems via Cumulative-Exposure Audit-Point Placement

BRA-Audit:基于累积暴露审计点放置的LLM多智能体系统预算运行时审计

Kaixiang Wang, Yidan Lin, Jiong Lou, Jie Li

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 BRA-Audit是一种预算感知的LLM多智能体系统运行时审计框架,通过贪心调度放置审计点,在保障防护性能的同时降低了17.2%-40.6%的端到端token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16438 2026-08-18 cs.AI cs.CC cs.IT math.IT 新提交 90%

The Value of a Prompt: An LLM-Relative Kolmogorov-Complexity Approach

提示的价值:一种大语言模型(LLM)相对柯尔莫哥洛夫复杂度的方法

Rafael Pass

机构 * Cornell Tech(康奈尔科技学院) Technion(以色列理工学院) TAU(特拉维夫大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究提出LLM相对的概率性Levin–柯尔莫哥洛夫复杂度pKt,将提示价值定义为相对于pKt的算法互信息,可高效估算,且提示价值b位对应无提示时复制z的中位数token成本为有提示时的2^b倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13667 2026-08-17 cs.AI cs.SE 新提交 90%

Second Thought: Reasoning in Parallel as LLM Agents Act and Observe

Second Thought:LLM智能体行动与观察时的并行推理

Zhensu Sun, Chengran Yang, Yunbo Lyu, Jieke Shi, David Lo

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出无需训练的推理框架Second Thought,利用LLM智能体行动与观察的空闲窗口并行推理,在多基准测试中降低轮次、减少主线程解码量,且Pass@1表现优于计算匹配对照组。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13450 2026-08-14 cs.SE cs.CR cs.LG 新提交 90%

LLM-Assisted Dynamic Threat Analysis for Attacker-Reachable Software Weaknesses in Autonomous Vehicles

大语言模型辅助的自动驾驶车辆中攻击者可及软件弱点的动态威胁分析

Md Wasiul Haque, Sagar Dasgupta, Mizanur Rahman, Md Rayhanur Rahman

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对自动驾驶车辆软件弱点的动态威胁分析难题,探究LLM辅助Autoware的自动化测试工件生成,发现构建集成是核心障碍,推理模型编译测试用例的表现优于代码专用模型。

Comments 17 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12123 2026-08-13 cs.DC cs.AI cs.OS 新提交 90%

Ready Cohorts: Bounding GPU Opportunity and Avoiding Host Round Trips in LLM-Agent Control

就绪队列:在LLM智能体控制中限定GPU机会并避免主机往返

Josef Liyanjun Chen

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究针对LLM智能体控制,提出就绪队列边界的形式化方法,通过实验验证设备驻留路由决策路径可提升效率,为GPU智能体控制确立了两个可测量门限。

Comments 14 pages, 4 figures. Includes formal proofs, trace provenance, and a reproducibility appendix. Code and artifacts: https://github.com/josefchen/ready-cohorts ; processed evidence: https://huggingface.co/datasets/josefchen/ready-

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11888 2026-08-13 cs.AI 新提交 90%

Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents

智能体技能可能有害:LLM智能体中技能诱导故障的实证研究

Gen Dong, Yanjie Gao, Liqun Li, Tianyin Xu, Yu Hua, Fan Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Microsoft Research(微软研究院) Microsoft(微软) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过提出差异分析框架,在SkillsBench等数据集上发现LLM智能体的技能会引发功能故障与效率回归,并构建SkillTriage工具,为安全复用技能提供研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10149 2026-08-12 cs.LG 新提交 90%

REATS: LLM Reasoning-based Ensemble Learning for Adaptive Time Series Forecasting

REATS:基于大语言模型推理的集成学习用于自适应时间序列预测

Xu Zhang, Chang Xu, Hui Sun, Nan Ma, Zijian Zhang, Peng Wang, Wei Wang, Li Zhao

机构 * Fudan University(复旦大学) Microsoft Research(微软研究院) Nankai University(南开大学) Jilin University(吉林大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);SFT(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对单一时间序列预测模型的局限性,提出基于LLM推理的REATS集成方法,通过三方面设计实现样本自适应可解释加权,在八个基准测试上优于竞争基线,具备强泛化与迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09168 2026-08-11 cs.AI 新提交 90%

From Relevance to Execution Utility: Reward-Aware Dynamic Execution Gating for Skill-Based LLM Agents

从相关性到执行效用:面向基于技能的大语言模型智能体的奖励感知动态执行门控

Liang He, Jingbo Wen, Hongyu Gu, Hao Li, Haoyu Wang, Yixiong Chen, Kangning Cui, Xilu Wang

机构 * Tongji University(同济大学) The University of Sydney(悉尼大学) University of Science and Technology of China(中国科学技术大学) Nankai University(南开大学) Johns Hopkins University(约翰斯·霍普金斯大学) City University of Hong Kong(香港城市大学) University of Surrey(萨里大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对基于技能的LLM智能体执行决策难题,提出RADEG轻量型决策层,通过学习代理模型预测执行效用,在288个rollout的评估中减少不必要执行并优于基线方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08889 2026-08-11 cs.AI 新提交 90%

LLM Reasoning for Subjective Tasks: Failure Modes, Mitigation, and Dynamic Reasoning Routing

用于主观任务的大语言模型推理:失败模式、缓解措施与动态推理路由

Juncheng Dong, Ding Tong, Ishan Gupta, Yuyan Wang

机构 * Duke University(杜克大学) Netflix(网飞公司)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究针对主观任务中LLM推理的失败模式,提出带条件长度惩罚的后训练算法缓解推理崩溃,还发现推理风格不匹配是主观验证误差主因,给出算法补丁与架构蓝图。

Comments 20th ACM Conference on Recommender Systems (RecSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07637 2026-08-11 cs.AI cond-mat.mtrl-sci 新提交 90%

Agent-MD: Selective LLM Intervention with Event-Driven Escalation for Stateful GCMC--MD Campaigns

Agent-MD:用于有状态GCMC-MD模拟流程的带事件驱动升级机制的选择性大语言模型干预框架

Yijie Wang, Zhen-Yu Yin, Zhenheng Tang, Xiaowen Chu

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Agent-MD框架将LLM推理选择性用于GCMC-MD分子模拟流程的构建与事件审查,结合确定性执行,在蒙脱石水蒸汽脱附模拟中完成多周期计算,识别问题并揭示体系依赖的低湿度响应,实现可复现的代理辅助分子模拟。

Comments 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏