arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 911 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 911 篇

2608.02955 2026-08-05 cs.HC cs.AI cs.CY eess.IV 新提交 81%

Chat Debugging: An Exploratory Study of Human-AI Collaboration to Debug Analog Circuits

聊天调试:人机协作调试模拟电路的探索性研究

John Hu, Andrew Ash

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过分析本科生与开源大型语言模型(LLMs)协作调试模拟电路的聊天记录,揭示了人机协作调试的模式、LLMs的优势与不足及学生的技能短板,为优化人机协作调试提供了依据。

Comments This is the accepted version of a paper to be presented at the 2026 IEEE Frontiers in Education Conference (FIE). The final version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02712 2026-08-05 cs.SE cs.AI 新提交 81%

Don't Regenerate, Debug: A Domain-Specific Agent for Repairing Near-Miss Hardware Operators

不要重新生成,要调试:一种用于修复近失配硬件算子的领域特定智能体

Yansong Sun, Shenxiu Wu, Siyuan Chen, Runlin Hou, Junhao Qiu, Junming Cao, Shudi Shao, Zhichao Lu, Qingfu Zhang

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出领域特定调试智能体,通过调试而非重新生成修复硬件近失配算子,其调试Pass@1准确率更高、token消耗更少,可拓展能力边界并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28027 2026-07-31 cs.MA cs.AI cs.CE 新提交 81%

VISA: A Structured Description Protocol for Agent-Based Simulation Models Towards Machine Reproducibility

VISA:面向智能体可复现性的智能体仿真模型结构化描述协议

Zhou He

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出VISA结构化描述协议,通过八个表格及可执行规则、LLM技能提升智能体模型可复现性,在三类平台的ABMs上验证了其有效性,将复现障碍转化为可处理的依赖项。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28200 2026-07-31 physics.app-ph cond-mat.mtrl-sci cs.AI 新提交 81%

Vibe-FDTR: An agent-oriented framework for reproducible frequency-domain thermoreflectance data analysis

Vibe-FDTR:一种面向智能体的可复现频域热反射数据分析框架

Fuwei Yang, Weiheng Li, Bai Song

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Vibe-FDTR是面向智能体的FDTR数据分析框架,结合领域代码包与智能体技能,在基准测试中表现优异,可降低计算成本与执行时间,助力低门槛可信热计量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21625 2026-07-27 cs.AI 新提交 81%

Trajectory-Aware Retrieval Agents for Temporal Decision- Making

用于时间决策的轨迹感知检索代理

Jing Wang, Jie Shen, Xing Niu

机构 * Amazon(亚马逊)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究用大语言模型代理从长篇时间结构化文本中决策的问题,针对标准RAG丢弃时间结构缺陷,引入闭环代理框架TLM,其关键技术是LGCM,在医学问答、收益电话会议惊喜预测和隔夜股票缺口预测任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20560 2026-07-24 cs.LG 新提交 81%

Chronofy: A Temporal-Logical Decay Architecture for Information Validity in Time-Aware Retrieval-Augmented Generation

Chronofy:一种用于时间感知检索增强生成中信息有效性的时态逻辑衰减架构

Muntaser Syed, Marius Silaghi, Sheikh Abujar, Sharun Akter

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对RAG系统中因未考虑时间来源导致的时间幻觉问题,提出Chronofy三层神经符号框架,通过嵌入时间有效性到表示、检索和推理层,经实验验证该框架能提高检索精度、减少幻觉并启用数据重新获取触发机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14970 2026-07-17 cs.AI 新提交 81%

Explaining Process Control Optimisation Recommendations via GradientSHAP and Implicit Differentiation

通过GradientSHAP和隐函数求导解释过程控制优化建议

Paul Darm, Cem Alpturk, Kenneth Ulrich, William Duncan, Ali Anwar, Annalisa Riccardi

机构 * University of Strathclyde(斯特拉斯克莱德大学) Weir(威尔)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对工业过程控制优化中算法设计者与操作员的信任问题,提出结合隐函数定理灵敏度分析、SHAP归因及大语言模型叙述生成的方法,在HPGR控制优化问题上实现等效SHAP归因且加速超40倍,能实时生成自然语言解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10522 2026-07-14 cs.CV cs.AI 新提交 81%

Towards Autonomous and Auditable Medical Imaging Model Development

迈向自主且可审计的医学成像模型开发

Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng, Cheng Wang, Zipei Wang, Wentao Pan, Hongtao Wu, Houwen Peng, Yu Gu, Lichao Sun, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Microsoft Research(微软研究院) Lehigh University(里海大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对医学成像模型开发困难的问题,提出AMID自主多代理框架。该框架含数据条件方法规划和验证引导两阶段优化,经20个医学成像任务验证,其性能优于通用MLE系统,能将特定任务模型开发转变为高效可审计的代理工作流程。

Comments 18 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08257 2026-07-10 cs.AI 新提交 81%

MentalHospital: A Virtual Environment for Evaluating Psychiatric Clinical Encounters

精神病院:一个用于评估精神科临床问诊的虚拟环境

Yuming Yang, Xiao Sun, Yuanwei Zou, Zhengxiao Wu, Yun Chen, Jiang Zhong, Haoyang Zeng, Jingwang Huang, Kaiwen Wei

机构 * School of Computer Science, Chongqing University(重庆大学计算机科学学院) School of Computer Science, Hunan University(湖南大学计算机科学学院)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究针对大语言模型在精神科临床问诊评估不足的问题,引入MentalHospital虚拟环境,实例化S.O.A.P.工作流程,用双轨协议评估,开发MentalEval,经测试其具有临床保真度且与专家高度一致,指出大语言模型在精神状态评估上落后临床医生。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01131 2026-07-02 cs.CV cs.AI 新提交 81%

Autonomous Scientific Discovery via Iterative Meta-Reflection

通过迭代元反射实现自主科学发现

Bingchen Zhao, Sara Beery, Oisin Mac Aodha

机构 * University of Edinburgh(爱丁堡大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DiscoPER框架,利用大语言模型进行开放式的自主科学发现,通过动态代码生成、统计检验和二阶推理机制,在iNatDisco基准上以72.7%假设支持率恢复8/9已知模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31820 2026-07-01 cs.AI 新提交 81%

Adaptive Cluster-First Route-Second Decomposition for Industrial-Scale Vehicle Routing

面向工业规模车辆路径问题的自适应先聚类后路由分解方法

Oguzhan Karaahmetoglu, Hyong Kim

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种自适应先聚类后路由分解系统,利用大语言模型作为高层决策者,迭代执行聚类、平衡和细化操作,实现容量感知的客户与车辆联合划分,在高达50万客户的实例上展现出竞争性性能和可扩展性。

Comments 29 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30662 2026-07-01 cs.CY cs.AI 新提交 81%

ELEVATE: Designing Human-Centered GenAI Virtual Tutors for Scalable and Inclusive Education

ELEVATE:面向可扩展与包容性教育的人本生成式AI虚拟导师设计

Lorenzo Stacchio, Michele Giordano, Daniele Berardini, Primo Zingaretti, Emanuele Frontoni

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ELEVATE框架,通过本地执行、多模态3D虚拟形象与教师治理层,实现隐私保护、低成本的生成式AI虚拟导师,解决云端文本聊天机器人存在的隐私、成本和数字鸿沟问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28044 2026-06-29 cs.CL 新提交 81%

A Tree-of-Thoughts Inspired Hybrid Approach for Legal Case Judgement Summarization using LLMs

一种基于思维树的混合方法用于法律案例判决摘要生成

Aniket Deroy, Kripabandhu Ghosh, Saptarshi Ghosh

机构 * IIT Kharagpur(印度理工学院德里加尔加尔普分校) IISER Kolkata(印度科学研究所科希拉)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种基于思维树的提取-抽象混合方法,利用LLMs(DeepSeek和LLama)生成法律判决摘要,实验表明该方法优于纯提取或纯抽象方法。

Comments Accepted at ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26481 2026-06-26 cs.CL cs.DL cs.IR 新提交 81%

Extracting Problem and Method Sentence from Scientific Papers: A Context-enhanced Transformer Using Formulaic Expression Desensitization

从科学论文中提取问题和方法句子:一种使用公式化表达脱敏的上下文增强Transformer

Yingyi Zhang, Chengzhi Zhang

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对科学论文中问题和方法句子提取任务,提出公式化表达脱敏的数据增强方法和上下文增强Transformer,在小型数据集上提升宏F1分数3.71%和2.67%。

Journal ref Scientometrics, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23913 2026-06-24 cs.LG 新提交 81%

Closing the Loop: Formally Verified Law as a Reward Signal for Self-Improving Legal AI

闭环:形式化验证的法律作为自我改进法律AI的奖励信号

Armin Heydari, Torben Leowald

机构 * Harvard University(哈佛大学) Columbia University(哥伦比亚大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出一种架构,通过LLM驱动的形式化转换和验证内核,为法律AI提供可验证的奖励信号,实现闭环强化学习,并在多个法律领域展示其优势。

Comments 14 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22101 2026-06-23 cs.LG cs.CV 新提交 81%

OphthaDT: Generative Digital Twins for Forecasting Visual Acuity Trajectories in Ophthalmology

OphthaDT:用于眼科视力轨迹预测的生成式数字孪生

Pietro Belligoli, Nikita Makarov, Sayedali Shetab Boushehri, Fabian Schmich, Raul Rodriguez-Esteban, Michael Menden

机构 * Computational Sciences Center of Excellence, Roche, Penzberg, Germany(计算科学卓越中心,罗氏,彭茨贝格,德国) Computational Health Center, Helmholtz Munich, Munich, Germany(计算健康中心,亥姆霍兹慕尼黑,慕尼黑,德国) Department of Biology, Ludwig Maximilian University of Munich, Munich, Germany(生物学系,路德维希-马克西米利安-慕尼黑大学,慕尼黑,德国) Computational Sciences Center of Excellence, Roche, Basel, Switzerland(计算科学卓越中心,罗氏,巴塞尔,瑞士) Department of Biochemistry and Pharmacology, Bio21 Molecular Science and Biotechnology Institute, The University of Melbourne, Parkville, Australia(生物化学与药理学系,Bio21分子科学与生物技术研究所,墨尔本大学,帕克维尔,澳大利亚) Technical University of Munich, Munich, Germany(慕尼黑工业大学,慕尼黑,德国)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出基于LLM的数字孪生OphthaDT,通过序列化纵向患者历史预测最佳矫正视力,在nAMD和DME数据集上分别降低MAE 6.0%和2.6-6.9%,尤其擅长处理高变异性轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21977 2026-06-23 cs.CY cs.AI cs.HC 新提交 81%

Old Fictions, New Skins: Evaluating the Manipulative Capabilities of LLMs in Healthcare

旧小说,新皮肤:评估LLM在医疗保健中的操纵能力

Gathoni Ireri, Roger D. Odipo

机构 * ILINA Program(ILINA项目) Haki AI

专题命中 领域大模型 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过随机实验发现,ChatGPT 5.2和DeepSeek V3.2在肯尼亚参与者中能显著操纵其治疗决策,成功率从44.0%升至59.5%,凸显非洲医疗AI中防范操纵的必要性。

Comments 28 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20776 2026-06-23 cs.SE cs.AI cs.NE 新提交 81%

Formally Verified Code Synthesis for Structured Data Translation in a Medical Internet of Things

医疗物联网中结构化数据翻译的形式化验证代码合成

Colin Samplawski, Adam D. Cobb

机构 * Computer Science Laboratory, SRI International(SRI国际计算机科学实验室)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出一种基于LLM的进化代码合成系统,集成形式化验证步骤,用于医疗物联网中结构化数据翻译,确保生成代码满足预定义需求,并以脉搏血氧仪集成案例展示其低开销生成正确翻译的能力。

Comments Spotlight Paper at the Workshop on Structured Data for Health at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19464 2026-06-19 cs.AI cs.MA 新提交 81%

Deontic Policies for Runtime Governance of Agentic AI Systems

面向自主AI系统运行时治理的道义策略

Anupam Joshi, Tim Finin, Karuna Pande Joshi, Lalana Kagal

机构 * CSEE Department UMBC Baltimore, MD, USA Center for AI UMBC Baltimore, MD, USA Information Systems Department UMBC Baltimore, MD, USA CSAIL MIT Cambridge, MA, USA

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型驱动的自主AI系统在安全、隐私和合规方面的治理挑战,提出AgenticRei框架,利用基于Rei的道义策略语言(OWL表示)在运行时通过逻辑引擎强制执行义务、豁免、冲突解决等治理约束,并兼容A2AS等标准。

Comments 10 pages, 1 figure. To be published in the 2026 IEEE Symposium on Agentic Services which is part of the IEEE Conference on Web Services

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18425 2026-06-18 cs.SE cs.AI cs.DC 新提交 81%

From Specification to Execution: AI Assisted Scientific Workflow Management

从规范到执行:AI辅助的科学工作流管理

Komal Thareja, Hamza Safri, Rajiv Mayani, Anirban Mandal, Ewa Deelman

机构 * RENCI, University of North Carolina at Chapel Hill, NC, USA(RENCI,北卡罗来纳大学教堂山分校) Information Sciences Institute, University of Southern California, Marina del Rey, CA, USA(信息科学研究所,南加州大学马里纳德尔雷耶斯分校)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种AI辅助方法,通过规范驱动的工作流生成、自动化调试和分布式执行,结合Pegasus与MCP层,实现从自然语言到大规模科学工作流的端到端管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18381 2026-06-18 cs.CL cs.IR 新提交 81%

SproutRAG: Attention-Guided Tree Search with Progressive Embeddings for Long-Document RAG

SproutRAG: 基于注意力引导的树搜索与渐进嵌入的长文档RAG

Amirhossein Abaskohi, Issam H. Laradji, Peter West, Giuseppe Carenini

机构 * University of British Columbia(不列颠哥伦比亚大学) ServiceNow Research(ServiceNow研究院)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出SproutRAG,通过注意力引导构建句子级分块树,实现多粒度检索,无需额外LLM调用,平均信息效率提升6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17791 2026-06-17 cs.CL cs.CV 新提交 81%

The Slop Paradox: How Synthetic Standardization Erodes Clinical Uncertainty and Cross-Modal Alignment in AI-Rewritten Radiology Reports

Slop悖论:合成标准化如何侵蚀AI重写放射学报告中的临床不确定性和跨模态对齐

Samar Ansari

机构 * School of Computing and Engineering Sciences, University of Chester(切斯特大学计算与工程科学学院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过控制实验测量AI重写放射学报告导致的信息退化,发现电子健康记录摘要虽破坏内容但保留图像-文本对齐,而标准化重写和教学病例准备则相反,造成更大对齐损失,称为slop悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17220 2026-06-17 cs.AI 新提交 81%

When Rules Learn: A Self-Evolving Agent for Legal Case Retrieval

当规则学习时:一种用于法律案例检索的自演化智能体

Mingxu Tao, Jiawei Hu, Xian Zhou, Wenpeng Hu, Jiajun Cheng, Yunbo Cao, Zhunchen Luo, Guotong Geng

机构 * Center of Information Research, AMS(AMS信息研究中心) Discipline and Technology Research Center for Large Model Intelligence Applications(大模型智能应用学科与技术研究中心) Hebei University of Engineering(河北工程大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出一种自演化框架,通过LLM智能体自动生成并优化查询重写规则,无需参数训练即可增强BM25在法律案例检索中的性能。

Comments To appear in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16751 2026-06-16 cs.CR cs.AI 新提交 81%

Automated jailbreak attack targeting multiple defense strategies

针对多种防御策略的自动化越狱攻击

Qi Wang, Chengcheng Wan, Weijia He, Yanqing Li, Hanqi Sun, Xiaodong Gu, Jiangtao Wang

机构 * East China Normal University(东华大学) Shanghai Innovation Institute(上海创新研究院) University of Southampton(南安普顿大学) Shanghai Jiao Tong University(上海交通大学) Software Engineering Institute, East China Normal University(东华大学软件工程研究院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出UNIATTACK框架,从防御视角提取攻击特征并优化,实现跨模型和类别的单次黑盒攻击,显著提升成功率并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16484 2026-06-16 cs.CV cs.AI cs.MM 新提交 81%

Unified Multimodal Model for Brain MRI Imputation and Understanding

统一多模态模型用于脑MRI补全与理解

Zhiyun Song, Che Liu, Tian Xia, Avinash Kori, Wenjia Bai

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出UniBrain模型,通过统一训练策略联合处理脑MRI模态补全与图像理解,采用自对齐和动态隐藏状态机制,在多疾病数据集上实现高性能。

Comments Early accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16330 2026-06-16 cs.AI 新提交 81%

Phase-Aware Guidance Injection for Recurrent MAPPO in Assembly-Line Disruption Recovery

装配线中断恢复中面向阶段的引导注入用于循环MAPPO

Xin Huang, Yongcai Wang, Fengyi Zhang, Zhikun Tao, Yunjun Han, Naiqi Wu

机构 * School of Information, Renmin University of China(中国人民大学信息学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) The Information Science Academy, China Electronics Technology Group Corporation(中国电子科技集团公司信息科学研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Institute of Systems Engineering, Macau University of Science and Technology(澳门科技大学系统工程研究所)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出面向阶段的引导注入框架,在评估时通过logit级动作偏置增强训练好的循环MAPPO调度策略,利用规则、回放和在线LLM引导减少异常恢复时间并保持准时交付。

Comments 6 pages, 4 figures, accepted by the 2026 IEEE International Conference on Automation Science and Engineering (CASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12291 2026-06-16 cs.CL 新提交 81%

Measuring Epistemic Resilience of LLMs Under Misleading Medical Context

测量大语言模型在误导性医疗上下文下的认知韧性

Hongjian Zhou, Xinyu Zou, Jinge Wu, Sean Wu, Junchi Yu, Bradley Max Segal, Tobias Erich Niebuhr, Sara Amro, Michael Petrus, Sheikh Momin, Alexandra M. Cardoso Pinto, Rachel Niesen, Laura Sophie Wegner, Dhruv Darji, Jung Moses Koo, Joshua Fieggen, Kapil Narain, Mingde Zeng, Lei Clifton, Linda Shapiro, Fenglin Liu, David A. Clifton

机构 * University of Oxford(牛津大学) University of Washington(华盛顿大学) University College London(伦敦大学学院) University of Waterloo(滑铁卢大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出MedMisBench基准,通过注入误导性上下文测试大语言模型在医疗场景中的认知韧性,发现模型准确率从71.1%降至38.0%,权威性虚假信息攻击成功率达69.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14149 2026-06-15 cs.LG 新提交 81%

Trust but Verify: Mitigating Medical Hallucinations via Post-Hoc Adversarial Auditing and Multi-Agent Feedback Loops

信任但验证:通过事后对抗审计和多智能体反馈循环减轻医学幻觉

Muhammad Osama, Maheera Amjad, Zartasha Mustansar, Arslan Shaukat, Muhammad U. S. Khan

机构 * Data Science and Machine Learning Lab, SINES, NUST(NUST SINES数据科学与机器学习实验室) SINES, NUST(NUST SINES) CEME, NUST(NUST CEME)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出一种五智能体“信任但验证”系统,通过事后对抗审计和多智能体反馈循环,将大型语言模型在临床问题中推荐禁用药品的幻觉错误率降低约53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11238 2026-06-12 q-fin.GN cs.AI 新提交 81%

Artificial Intelligence in Ship Finance: Applications, Opportunities, and a Case Study in AI-Augmented Loan Origination

人工智能在船舶金融中的应用:机遇与AI增强贷款发起的案例研究

Lasse Dierich, Orestis Schinas

机构 * ShipFinance.ai HHX.blue GmbH Technical University of Munich(慕尼黑技术大学) University of the Aegean(爱琴海大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨AI在船舶金融中的应用,提出基于大语言模型的模块化架构,用于文档理解、信息提取和工作流自动化,以支持贷款申请流程。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08307 2026-06-09 cs.CL 新提交 81%

Understanding the Sociocultural Dimensions of Mental Health Discourse in Arabic-Language X Communities

理解阿拉伯语X社区中心理健康话语的社会文化维度

Amal Alqahtani, Rana Salama, Mona Diab

机构 * King Saud University(沙特国王大学) Cairo University(开罗大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 通过GPT-4.1识别个人披露的推特用户,分析边缘型人格障碍、双相障碍和ADHD相关话语,发现不同病症的词汇模式差异,提出可复用的LLM辅助披露流程和文化关键词框架。

Comments Accepted to the SMM4H-HeaRD Workshop, co-located with the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏