arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12761 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 12761 篇

2604.28087 2026-05-12 cs.LO cs.AI 70%

Towards Neuro-symbolic Causal Rule Synthesis, Verification, and Evaluation Grounded in Legal and Safety Principles

迈向基于法律和安全原则的神经符号因果规则合成、验证与评估

Zainab Rehan, Christian Medeiros Adriano, Sona Ghahremani, Holger Giese

机构 * Hasso Plattner Institute \ of Potsdam Prof.-Dr.-Helmert Str. 2-3, D-14482 Potsdam, Germany Hasso Plattner Institute \ of Potsdam

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种神经符号因果框架,结合一阶逻辑抽象树、结构因果模型和深度强化学习,通过Meta层缓解目标误指定问题,实现可扩展的规则维护。

Journal ref Neurosymbolic eXplainable Trustworthy Systems @ AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06286 2026-05-12 cs.AI 70%

When Agents Say One Thing and Do Another: Validating Elicited Beliefs from LLMs

当代理人言辞与行为不一致时:从LLMs中验证提取的信念

Khurram Yamin, Jingjing Tang, Santiago Cortes-Gomez, Amit Sharma, Eric Horvitz, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种决策理论框架,通过提取概率判断和决策并检验其一致性,验证LLMs的信念是否合理,发现最强模型的不一致程度较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07613 2026-05-11 cs.CL 70%

Intent-Driven Semantic ID Generation for Grounded Conversational News Recommendation

基于意图的语义ID生成用于 grounded 对话新闻推荐

Hongyang Su, Beibei Kong, Lei Cheng, Chengxiang Zhuo, Zang Li, Chenyun Yu

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Platform and Content Group, Tencent(腾讯平台与内容部)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出意图驱动的语义ID生成方法,通过多任务对齐和GPT-4链式推理蒸馏,实现意图到层级SID前缀的映射,提升新闻推荐的 grounded 性和冷启动用户推荐效果。

Comments Accepted at ACL 2026 Industry Track (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07039 2026-05-11 cs.LG 70%

PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents

PACEvolve++: 提高进化搜索代理的测试时学习

Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Shuo Chen, Zhankui He, Noveen Sachdeva, Weili Wang, Ed H. Chi, Shivaram Venkataraman, Wang-Cheng Kang, Derek Zhiyuan Cheng, Beidou Wang

机构 * Google(谷歌) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google DeepMind(谷歌DeepMind)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PACEvolve++通过强化学习框架提升进化搜索代理的测试时策略适应能力,采用可训练顾问生成并评估假设,结合前沿模型生成可执行候选,实现更快收敛和更稳定的测试时训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01423 2026-05-05 hep-ex cs.AI cs.MA 70%

HepScript: A Dual-Use DSL for Human-AI Collaborative Data Analysis Workflows in High-Energy Physics

HepScript:一种双用途DSL,用于高能物理中的人工智能协作数据分析工作流

Junkun Jiao, Tong Liu, Ke Li, Weimin Song, Yipu Liao, Bolun Zhang, Beijiang Liu, Chang-Zheng Yuan, Yue Sun

机构 * Jilin University(吉林大学) Institute of High Energy Physics, CAS(高能物理研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HepScript通过双用途DSL提升高能物理数据分析效率,减少人工编写代码93%,AI可自主生成95%的成功执行规范。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01077 2026-05-05 cs.CL 70%

Teaching LLMs Brazilian Healthcare: Injecting Knowledge from Official Clinical Guidelines

教大语言模型巴西医疗:注入官方临床指南的知识

Hugo Abonizio, Filipe Rocha Lopes, Roberto Lotufo, Rodrigo Nogueira

机构 * FEEC, UNICAMP(UNICAMP电子工程学院) Maritaca AI

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过适配Qwen2.5-14B-Instruct模型,生成合成数据并采用持续预训练和GRPO方法,构建了HealthBench-BR和PCDT-QA基准,实现了在巴西医疗领域上的高准确率表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14259 2026-05-04 cs.IR cs.AI 70%

GenRecEdit: Adapting Model Editing for Generative Recommendation with Cold-Start Items

GenRecEdit:为生成推荐适应模型编辑以应对冷启动项目

Chenglei Shen, Teng Shi, Weijie Yu, Xiao Zhang, Jun Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学全球化人工智能学院) School of Information Technology and Management, University of International Business and Economics(国际经济贸易大学信息科学技术与管理学院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GenRecEdit通过模型编辑技术解决生成推荐中冷启动问题,通过迭代token级编辑和一对一触发机制提升冷启动项目推荐性能,仅需9.5%的训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27969 2026-05-01 cs.SE cs.AI 70%

From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation

从幻象到基础:迈向可靠的多模态电路到Verilog代码生成

Guang Yang, Xing Hu, Xiang Chen, Xin Xi

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou(杭州高新技术区(滨江)区块链与数据安全研究院,杭州) School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出VeriGround模型,通过标识符匿名化、拒绝增强和D-ORPO对齐,解决了多模态模型在电路到Verilog代码生成中的可靠性问题,验证了真实视觉基础的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14352 2026-05-01 cs.CY cs.AI cs.LO 70%

Epistemic reflections on AI answering our questions: overwatch, erudite, logician, interlocutor

关于AI回答问题的认知反思:监视、博学、逻辑学家、对话者

Johan F. Hoorn, Ella-Jenna Oosterglorenwoud

机构 * The Hong Kong Polytechnic University(香港理工大学) Eindhoven University of Technology (TU/e)(埃因霍温理工大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文探讨AI在金融、法律等领域被广泛依赖的问题,指出其缺乏逻辑验证和实证验证,可能导致误判和剽窃。提出需了解推理系统以使AI成为可信的对话伙伴。

Comments 22 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08618 2026-04-30 cs.IR cs.AI cs.SE 70%

SkillForge: Forging Domain-Specific, Self-Evolving Agent Skills in Cloud Technical Support

SkillForge: 在云技术支持中锻造领域特定的自我进化代理技能

Xingyan Liu, Xiyue Luo, Linyu Li, Ganghong Huang, Jianfeng Liu, Honglin Qiao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 SkillForge通过闭环创建-评估-改进机制,解决云技术支持中领域特定技能缺乏和持续优化的问题,实验表明其能显著提升技能质量。

Comments Accepted at ACM SIGIR 2026 Industry Track. 18 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23040 2026-04-30 stat.OT cs.AI 70%

Treatment, evidence, imitation, and chat

治疗、证据、模仿与聊天

Samuel J. Weisenthal

机构 * samweisenthal

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨大型语言模型在医疗决策中的潜力,分析治疗与聊天问题的差异,指出模仿方法的局限性,并讨论伦理和观察假设等挑战。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11100 2026-04-29 cs.AI 70%

ReCreate: Reasoning and Creating Domain Agents Driven by Experience

ReCreate:基于经验的推理与创造领域代理框架

Zhezheng Hao, Hong Wang, Jian Luo, Jianqing Zhang, Yuyan Zhou, Qiang Lin, Can Wang, Hande Dong, Jiawei Chen

机构 * Zhejiang University(浙江大学) Tencent(腾讯) Independent Researcher(独立研究者) Shanghai Jiao Tong University(上海交通大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ReCreate框架,通过利用代理交互历史,自动创建和适应领域代理,优于人类设计和现有自动化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25296 2026-04-29 cs.CL 70%

Learning from Medical Entity Trees: An Entity-Centric Medical Data Engineering Framework for MLLMs

从医学实体树学习:一种以实体为中心的医疗数据工程框架用于多模态大语言模型

Jianghang Lin, Haihua Yang, Deli Yu, Kai Wu, Kai Ye, Jinghao Lin, Zihan Wang, Yuhang Wu, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学,中国) ByteDance(字节跳动) Northeastern University(东北大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出以实体为中心的医疗数据工程框架,通过构建医学实体树,提升多模态大语言模型在医疗领域的表现,通过实体引导检索、双重过滤和知识感知数据合成等方法,增强模型处理复杂临床问题的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22762 2026-04-29 cs.IR cs.AI 70%

Behavioral Intelligence Platforms: From Event Streams to Autonomous Insight via Probabilistic Journey Graphs, Behavioral Knowledge Extraction, and Grounded Language Generation

行为智能平台:通过概率旅程图、行为知识提取和 grounded 语言生成从事件流到自主洞察

Arun Patra, Bhushan Vadgave

机构 * Journium, Inc.(Journium公司)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出行为智能平台BIP,通过概率旅程图、行为知识提取和 grounded 语言生成,将原始事件流转化为自动洞察,解决传统主动查询模式的瓶颈问题。

Comments v2: corrected numerical values in Fig 3 and Sec 7.2 fact bundle to match published simulation scripts; clarified Markov-property identity in Sec 4.2.2; added simulate_trajectories.py for Monte Carlo reproducibility; softened confidence and path-quality presentation; added Markov-attribution citations (Anderl 2016, Shao & Li 2011, Kakalejcik 2022). Formal results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23413 2026-04-28 cs.CL 70%

Beyond Local vs. External: A Game-Theoretic Framework for Trustworthy Knowledge Acquisition

超越局部与外部:一种博弈论框架用于可信知识获取

Rujing Yao, Yufei Shi, Yang Wu, Ang Li, Zhuoren Jiang, XiaoFeng Wang, Haixu Tang, Xiaozhong Liu

机构 * Nankai University(南开大学) The Hong Kong Polytechnic University(香港理工大学) Worcester Polytechnic Institute(沃斯通理工学院) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Indiana University Bloomington(印第安纳大学布利克学院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出GTKA框架,通过博弈论平衡知识效用与隐私,设计隐私感知子查询生成器、对抗重建攻击者和可信本地整合器,减少敏感意图泄露并保持高答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23257 2026-04-28 cs.SE cs.AI 70%

Knowledge Lever Risk Management for Software Engineering: A Stochastic Framework for Mitigating Knowledge Loss

软件工程中的知识杠杆风险管理:一种缓解知识损失的随机框架

Mark Chua, Samuel Ajila

机构 * Department of Systems and Computer Engineering(系统与计算机工程系) Carleton University(卡尔顿大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出知识杠杆风险管理框架,通过将无形知识资产转化为风险缓解机制,结合四个阶段架构和随机模型,提升软件开发项目中的知识资本和项目成功率。

Comments A shorter version of the paper will be presented on the 24th IEEE/ACIS International Conference on Software Engineering Research, Management and Applications (SERA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23067 2026-04-28 cs.CR cs.CL 70%

Training a General Purpose Automated Red Teaming Model

训练通用自动化红队模型

Aishwarya Padmakumar, Leon Derczynski, Traian Rebedea, Christopher Parisien

机构 * NVIDIA

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出一种通用红队模型训练方法,能适应任意对抗目标,无需依赖预训练评估器,通过微调小模型显著提升生成攻击的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22337 2026-04-27 cs.LG 70%

TabSCM: A practical Framework for Generating Realistic Tabular Data

TabSCM:生成真实表格数据的实用框架

Sven Jacob, Bardh Prenkaj, Weijia Shao, Gjergji Kasneci

机构 * Federal Institute for Occupational Safety and Health (BAuA)(联邦职业安全与健康研究所) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 TabSCM通过保留因果依赖生成真实表格数据,结合条件扩散模型和梯度提升树提高生成质量,同时在多个数据集上优于现有方法,提升解释性和因果鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22325 2026-04-27 cs.CL 70%

Dynamically Acquiring Text Content to Enable the Classification of Lesser-known Entities for Real-world Tasks

动态获取文本内容以实现对较少见实体的分类以支持现实任务

Fahmida Alam, Ellen Riloff

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过动态获取实体描述文本,利用网络和大语言模型构建任务特定分类器,解决现实任务中对较少见实体分类的问题,实验在组织和医疗提供者分类任务中取得较高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21965 2026-04-27 cs.AI 70%

Read the Paper, Write the Code: Agentic Reproduction of Social-Science Results

读论文,写代码:社会科学结果的代理重生产

Benjamin Kohler, David Zollikofer, Johanna Einsiedler, Alexander Hoyle, Elliott Ash

机构 * ETH Zurich(苏黎世联邦理工学院) University of Basel(巴塞尔大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出了一种代理重生产系统,通过提取论文中的方法描述,在不接触原始代码和数据的情况下复现社会科学结果,并通过误差溯源分析识别根本原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.10019 2026-04-26 stat.ML cs.LG 70%

Machine Learning Construction: implications to cybersecurity

机器学习构建:对网络安全的影响

Waleed A. Yousef

专题命中 领域大模型 :SLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文探讨了机器学习构建在网络安全中的重要性,强调了设计能从安全数据中学习的检测算法以提升威胁狩猎和监控能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08561 2026-04-24 cs.SE cs.CL 70%

Automating Computational Reproducibility in Social Science: Comparing Prompt-Based and Agent-Based Approaches

在社会科学中自动化计算可重复性:比较基于提示和基于代理的方法

Syed Mehtab Hussain Shah, Frank Hopfgartner, Arnim Bleier

机构 * University of Koblenz Koblenz Germany University of Koblenz

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型和AI代理能否自动诊断和修复计算失败,通过可控的可重复性测试平台评估两种方法在不同复杂度下的表现,发现基于代理的方法在可重复性上表现更优。

Comments 12 pages, 5 figures. Submitted to ACM conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19414 2026-04-22 cs.IR cs.LG 70%

CAST: Modeling Semantic-Level Transitions for Complementary-Aware Sequential Recommendation

CAST:基于语义级转换的互补意识序列推荐建模

Qian Zhang, Lech Szymanski, Haibo Zhang, Jeremiah D. Deng

机构 * School of Computing, University of Otago(奥塔哥大学计算机学院) University of New South Wales(新南威尔士大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出CAST框架,通过语义级转换模块和互补先验注入模块,有效捕捉可靠互补关系,提升序列推荐性能。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14165 2026-04-22 cs.CL 70%

EviSearch: A Human in the Loop System for Extracting and Auditing Clinical Evidence for Systematic Reviews

EviSearch:一个用于系统综述中提取和审计临床证据的人机协作系统

Naman Ahuja, Saniya Mulla, Muhammad Ali Khan, Zaryab Bin Riaz, Kaneez Zahra Rubab Khakwani, Mohamad Bassam Sonbol, Irbaz Bin Riaz, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 EviSearch通过多智能体系统自动化从原始试验PDF中生成与本体对齐的临床证据表,并提供细胞级可追溯性以供审计和人工验证,提升提取精度并减少手动校对负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13779 2026-04-22 cs.CV cs.AI 70%

AD-Copilot: A Vision-Language Assistant for Industrial Anomaly Detection via Visual In-context Comparison

AD-Copilot:通过视觉上下文比较实现工业异常检测的视觉-语言助手

Xi Jiang, Yue Guo, Jian Li, Yong Liu, Bin-Bin Gao, Hanqiu Deng, Jun Liu, Heng Zhao, Chengjie Wang, Feng Zheng

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(计算机科学与工程系,南方科技大学) Macau University of Science and Technology(澳门科技大学) Tencent YouTu Lab(腾讯YouTu实验室) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,A*STAR)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AD-Copilot通过视觉上下文比较提升工业异常检测性能,采用新颖的数据筛选流程和比较编码器,在多个基准测试中取得优异成绩,超越人类专家水平。

Comments Code and models are released at https://github.com/jam-cc/AD-Copilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12439 2026-04-22 cs.AI cs.MA 70%

Multi-agent Self-triage System with Medical Flowcharts

多代理自分级系统与医疗流程图

Yujia Liu, Sophia Yu, Hongyue Jin, Jessica Wen, Alexander Qian, Terrence Lee, Mattheus Ramsis, Gi Won Choi, Lianhui Qin, Xin Liu, Edward J. Wang

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) The Design Lab, University of California San Diego(加州大学圣地亚哥分校设计实验室) Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系) Department of Medicine, Kaiser Permanente(Kaiser 医疗集团医学部) Department of Radiation Oncology, University of California San Francisco(加州大学旧金山分校放射肿瘤学部) Department of Emergency Medicine, University of California San Francisco(加州大学旧金山分校急诊医学部) Division of Cardiology, Department of Medicine, University of California San Diego(加州大学圣地亚哥分校医学部心内科分会) Department of Orthopaedic Surgery, Korea University Ansan Hospital(韩国大学安山医院骨科部) Google Research, Seattle, WA, USA(谷歌研究(西雅图,华盛顿州)) Paul G. Allen School of Computer Science & Engineering, University of Washington(华盛顿大学保罗·G·阿伦计算机科学与工程学校)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种多代理自分级系统,利用100个经临床验证的流程图提升医疗决策的准确性与透明度,通过检索、决策和聊天代理实现患者个性化推荐,实验显示在大规模合成数据集上达到高准确率。

Journal ref Nature Health (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12643 2026-04-21 cs.CL 70%

LexRel: Benchmarking Legal Relation Extraction for Chinese Civil Cases

LexRel:中国民事案件法律关系抽取基准测试

Yida Cai, Ranjuexiao Hu, Huiyuan Xie, Chenyang Li, Yun Liu, Yuxiao Ye, Zhenghao Liu, Weixing Shen, Zhiyuan Liu

机构 * Tsinghua University(清华大学) Peking University(北京大学) University of Glasgow(格拉斯哥大学) Beijing University of Posts and Telecommunications(北京邮电大学) Queen Mary University of London(伦敦玛丽女王大学) Northeastern University(东北大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LexRel基准,用于评估法律关系抽取任务,揭示当前大语言模型在识别民事法律关系上的不足,并展示显式整合法律关系信息对下游法律AI任务的积极影响。

Comments Accepted to ACL 2026 (main conference). 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17282 2026-04-21 cs.CL 70%

MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning

MedPRMBench: 一种面向医疗推理过程奖励模型的细粒度基准

Lingyan Wu, Xiang Zheng, Weiqi Zhai, Wei Wang, Xuan Ren, Zifan Zhang, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MedPRMBench,首个医疗领域过程奖励模型基准,通过三阶段流程生成高质量数据,涵盖14种细粒度错误类型,评估模型在医疗推理中的误差检测能力,提升下游任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16765 2026-04-21 cs.SI cs.CL cs.CY 70%

Mapping Election Toxicity on Social Media across Issue, Ideology, and Psychosocial Dimensions

在选举议题、意识形态和心理社会维度上映射社交媒体上的选举毒性

Lei Cao, Wen Zeng, Xinyue Wu, Eun Cheol Choi, Emilio Ferrara

机构 * University of Southern California(南加州大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究通过分析社交媒体上的选举讨论,探讨毒性在不同议题、意识形态及心理社会维度上的差异,揭示毒性表达的驱动因素及情感与道德框架的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16506 2026-04-21 cs.CV cs.CL 70%

Medical thinking with multiple images

多图像医学推理

Zonghai Yao, Benlu Wang, Yifan Zhang, Junda Wang, Iris Xia, Zhipeng Tang, Shuo Han, Feiyun Ouyang, Zhichao Yang, Arman Cohan, Hong Yu

机构 * Manning College of Information and Computer Sciences, UMass Amherst(UMass阿默斯特信息与计算机科学学院) Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(VA贝福德医疗保健中心) Department of Computer Science, Yale University(耶鲁大学计算机科学系) Miner School of Computer and Information Sciences, UMass Lowell(UMass洛威计算机与信息科学学院) Department of Electrical and Computer Engineering, UMass Lowell(UMass洛威电气与计算机工程系)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MedThinkVQA多图像医学推理基准,通过专家标注数据验证多图像整合对临床推理的重要性,发现多图像推理瓶颈在于证据提取与对齐,且增加推理时间计算效果有限。

Comments Equal contribution for the first two authors. To appear in the proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026). Code is in https://github.com/benluwang/MedThinkVQA. Dataset is in https://huggingface.co/datasets/bio-nlp-umass/MedThinkVQA

详情

展开后加载摘要…

URL PDF HTML 收藏