arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 911 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 911 篇

2606.18699 2026-06-18 cs.CL cs.AI cs.IR 新提交 87%

TW-LegalBench: Measuring Taiwanese Legal Understanding

TW-LegalBench: 衡量台湾法律理解

Fei-Yueh Chen, Chun Huang Lin, Chan Wei Hsu, Kuan Hsuan Yeh, Zih-Ching Chen, Kuan-Ming Chen, Patrick Chung-Chia Huang

机构 * University of Rochester(罗切斯特大学) National Taiwan University(国立台湾大学) NVIDIA(英伟达)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出TW-LegalBench基准,包含多项选择、开放式问答和法律判决预测任务,评估13个LLM在台湾法律上的表现,发现顶尖模型通过律师考试但未达到法官检察官标准,且法律条文引用困难。

Comments 10 pages, 2 figures, To appear in ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09962 2026-06-10 cs.LG cs.AI cs.SD 新提交 87%

Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech

FSQ 令牌在分类数据连续扩散中的最优性及其在文本到语音中的应用

Vadim Popov, Wenju Gu, Tasnima Sadekova, Georgii Aparin, Assel Yermekova

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) National Research University Higher School of Economics(俄罗斯国家研究大学高等经济学院) National University of Science and Technology MISIS(俄罗斯科学与技术国立大学MISIS)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究连续扩散模型中离散令牌的潜在空间结构,通过理论分析和实验证明 FSQ 令牌化方案在分类数据连续扩散中最优,并在文本到语音任务中验证其优于基于 LLM 的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08969 2026-06-09 cs.CL cs.AI 新提交 87%

CARE: A Conformal Safety Layer for Medical Summarization

CARE:面向医学摘要的保形安全层

Suhana Bedi, Bridget Lin, Anson Y. Zhou, Chloe O. Stanwyck, Jenelle A. Jindal, Sanmi Koyejo, David Stutz, Nigam H. Shah

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出CARE方法,通过保形风险控制为LLM医学摘要提供校准的遗漏和幻觉标记,在保证安全性的同时减少审查负担。

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06823 2026-06-08 cs.LG cs.AI q-fin.ST 新提交 87%

PandaAI: A Practical Agent CQ2 for Neuro-symbolic Data Analysis And Integrated Decision-Making in Quantitative Finance

PandaAI: 一种用于量化金融中神经符号数据分析与集成决策的实用智能体CQ2

Yuqi Li, Siyuan Liu, Bingjun Liu

机构 * Panda AI

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对金融数据低信噪比和非平稳性,提出PandaAI,一种结合市场状态建模与约束alpha生成的闭环神经符号LLM智能体,通过领域微调和模块化架构实现风险感知决策,在沪深300数据上Rank IC提升18.2%,最大回撤降低25.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22419 2026-06-24 cs.CL cs.DB 新提交 87%

Knowledge-Graph Grounding Helps LLMs Only for Out-of-Training Knowledge: A Controlled Study on Clinical Question Answering

知识图谱基础仅对训练外知识帮助LLM:临床问答的受控研究

Madhulatha Mandarapu, Sandeep Kunkunuru

专题命中 领域大模型 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 通过受控实验发现,知识图谱基础仅在问题涉及模型训练外知识时提升LLM性能,对已知事实无帮助,且公共KG信息冗余。

Comments 9 pages. Code: https://github.com/samyama-ai/clinical-llm-graphrag

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16951 2026-08-19 q-bio.QM cs.MA 新提交 87%

The Little Scientist: LLM Agent-Driven Discovery via the Scientific Method

小科学家:基于大语言模型智能体的科学方法驱动发现

Travis Smith

专题命中 领域大模型 :LLM(title,summary_cn)

AI总结 该研究提出The Little Scientist框架,让LLM智能体遵循科学方法迭代探索,在蛋白质适应性预测、DNA基序发现问题上发现了优于现有方案的新算法与集成策略。

Comments Code: https://github.com/travis42/little-scientist-dale and https://github.com/travis42/little-scientist-delta-v (Apache 2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17567 2026-08-19 cs.LG cs.AI cs.CL 新提交 87%

Domain-Adapted Molecular Language Models for Efficient Search of Make-on-Demand Libraries

用于按需构建库高效搜索的领域适配分子语言模型

Henrik Wille, Luis-Finley Schütz, Felix Strieth-Kalthoff

专题命中 领域大模型 :language model(title,abstract);foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过在6个虚拟分子库上对4种分子语言模型进行基准测试,发现显式领域适配可提升分子表示性能,适配后的编码器在基准任务中表现最佳,为虚拟筛选等领域提供了样本高效的自适应决策策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16075 2026-08-18 cs.IR 新提交 87%

TRACER: Balancing Stability-Plasticity-Cognitivity Trilemma for LLM Enhanced Continual Recommendation

TRACER:平衡大语言模型增强型持续推荐的稳定性-可塑性-认知性三难困境

WooJoo Kim, HyunSik Yoo, JunYoung Kim, JaeHyung Lim, SeongKu Kang, HwanJo Yu

专题命中 领域大模型 :LLM(title,summary_cn)

AI总结 针对LLM增强持续推荐的SPC三难困境,提出TRACER模型,通过协同设计三个专用模块协调三难,在五组真实数据集上较最优基线最高提升14.38%

Comments Accepted to CIKM 2026 full research paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08497 2026-08-11 cs.HC cs.MA cs.SI 新提交 87%

SocialFiVis: A Visual Analytics Sandbox for LLM-Grounded Multi-Agent Simulation in Social Finance

SocialFiVis:面向社会金融中基于大语言模型的多智能体模拟的可视分析沙箱

Yi-Fan Cao, Qing Shi, Liangwei Wang, Leo Yu-Ho Lo, Lin Chen, Yuzi Han, Yang Wang, Kani Chen

专题命中 领域大模型 :LLM(title,summary_cn)

AI总结 该研究提出嵌入IAD框架的可视分析沙箱SocialFiVis,结合LLM与PRA引擎模拟多智能体,支持探索社会金融领域反事实政策并解释相关涌现现象。

Comments 11 pages, 7 figures, 2 tables. Accepted to IEEE VIS 2026; to appear in IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26885 2026-07-30 cs.CV 新提交 87%

SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation

SCALPEL:基于大语言模型驱动的编码器学习的医学视觉-语言语义跨模态对齐框架

Yunzhan Fu, Enyu Bao, Xiangyu Shen, Yihao Wu, Chunbo Jiang, Fangli Guan, Liqi Yan

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有医学视觉-语言预训练的三大瓶颈,本文提出SCALPEL框架,通过临床报告对比微调、非对称对齐策略及解剖-否定感知目标,在三大医学基准上实现了多项任务的最优性能。

Comments 14 pages, 3 figures, accepted by PRCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24859 2026-07-29 cs.CR 新提交 87%

The Mirage of LLM Guardrails: A Case Study in AI-Assisted Medical Note Manipulation

大语言模型护栏的幻象:人工智能辅助医疗记录操纵的案例研究

Davis Yadav, Amulya Yadav

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型在医疗记录操纵场景下内置护栏的可靠性,通过开发操纵流程、实证评估、利用多种指标评估及用户研究,揭示其弱点,为大语言模型在医疗领域的护栏设计、安全政策及伦理等方面提供参考。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11680 2026-07-14 physics.ed-ph physics.soc-ph 新提交 87%

From Prompt Engineering to Epistemic Prompting: Prompt Trajectories as AI-Mediated Problem Framing in Science Education

从提示工程到认知提示:提示轨迹作为科学教育中人工智能介导的问题框架

Matteo Tuveri

专题命中 领域大模型 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究探讨在STEM教育中提示不仅是技术能力,更是认知实践。基于认识论框架等提出认知提示新框架及多轮循环,形成提示框架轨迹,阐述其构建过程,还讨论了对人工智能介导的STEM教学及学习者与大语言模型交互的影响。

Comments 13 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12169 2026-06-11 cs.CV cs.AI cs.CL cs.LG 新提交 87%

OpenMedReason: Scientific Reasoning Supervision for Medical Vision-Language Models

OpenMedReason: 医学视觉语言模型的科学推理监督

Negin Baghbanzadeh, Pritam Sarkar, Michael Colacci, Abeer Badawi, Adibvafa Fallahpour, Arash Afkanpour, Leonid Sigal, Ali Etemad, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学) Unity Health Toronto / St. Michael’s Hospital(多伦多联合健康/圣迈克尔医院) University Health Network(大学健康网络) Arc Institute(弧研究所) Queen's University(女王大学)

专题命中 领域大模型 :language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OpenMedReason,一个包含约45万图像-问题-答案实例的大规模开放医学推理语料库,其推理轨迹主要来自生物医学科学文章,并配套基准OpenMedReason-Bench进行细粒度评估,在监督微调和强化对齐中有效提升模型性能。

Comments 42 pages, 9 figures, 24 tables. Dataset and code: https://huggingface.co/datasets/neginb/OpenMedReason

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21194 2026-06-23 cs.CV cs.AI cs.CL 新提交 87%

MEDLAYXPLAIN: Benchmarking the Expert-Lay Gap in Medical Vision-Language Models

MEDLAYXPLAIN: 医学视觉语言模型中的专家-外行差距基准测试

Han Jang, Junhyeok Lee, Songsoo Kim, Chae Young Lim, Hyeonjin Goh, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔大学) Seoul National University Hospital(首尔大学医院) Seoul National University College of Medicine(首尔大学医学院) Sungkyunkwan University School of Medicine(成均馆大学医学院)

专题命中 领域大模型 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出首个大规模医学外行语言生成基准MedLayXPlain,包含12万+区域级样本和三层UMLS本体,通过HOVER管道构建外行描述,并引入轻量级评估器MedLayEval,揭示当前医学VLM在外行可读性与临床精度间的系统性差距。

Comments 40 pages (10 pages main text, 30 pages appendix), 4 main figures, 33 vision-language models benchmarked

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17170 2026-08-19 cs.AI 新提交 86%

Synthesizing Feature Extractors: An Agentic Approach for Algorithm Selection

合成特征提取器:一种用于算法选择的智能体方法

Hai Xia, Carlos Ansótegui, Stefan Szeider

机构 * TU Wien(维也纳技术大学) University of Lleida(莱里达大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出一种基于LLM的智能体方法,通过检查-修复-验证循环合成可解释的特定问题特征提取器,在三类组合问题上的算法选择性能优于现有专家设计特征与Transformer变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14804 2026-08-18 cs.AI 新提交 86%

Generated Context versus Governed State: Functional Conditions for Accountable Longitudinal Clinical Reasoning

生成式上下文与受控状态:可问责纵向临床推理的功能条件

Augusto Bernardo Pissarra, Victor Lorena de Farias Souza

机构 * MyndwareMed(迈恩德韦尔医疗)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文区分生成式上下文与受控状态,定义可问责临床AI的审计标准与信息要求,提出六级成熟度框架,将当前LLM临床实践定位于高能力低成熟度,为可问责临床AI提供概念与审计工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11220 2026-08-13 cs.AI cs.MA 新提交 86%

LLMs in Process Diagram Engineering: From Optimal PFDs to Validated P&IDs

流程图表工程中的大语言模型:从最优工艺流程图到经验证的管道及仪表流程图

Timur Zakarin, Sergei Voitov, Sergei Shumilin, Evgeny Burnaev

机构 * Skoltech(斯科尔科沃科技学院) AIRI(人工智能研究院(AIRI))

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出P&ID Pilot端到端AI流水线,结合GA与LLM生成最优PFD,再通过基于LLM的智能体将其转换为100%执行成功的合规P&ID,实现工艺设计自动化并减少人工工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08883 2026-08-11 cs.AI 新提交 86%

AquiLLM: An Architecture for Supporting Tacit Knowledge Capture in Research Groups

AquiLLM:支持研究群体中隐性知识捕获的架构

Jack Stark, Srinath Saikrishnan, Vikram Seenivasan, Bernie Boscoe, Andrew Lizarraga, Tuan Do

机构 * Southern Oregon University(南俄勒冈大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AquiLLM是一款采用开放权重模型的开源模块化RAG-LLM框架,经领域专家反馈优化了架构与功能,可支持研究群体捕获隐性知识,助力AI贴合科研实践。

Comments Accepted for publication in the NGEN-AI 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07495 2026-08-11 cs.HC cs.AI 新提交 86%

EmoPatient: An Emotion-Directed Patient Simulator for Realistic Palliative Care Communication Training

EmoPatient:用于姑息治疗沟通训练的情绪导向患者模拟器

Yining Wu, Tianshu Du, Jinrui Fang, Chi Zhang, Sonal Admane, Ying Ding

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对现有LLM患者模拟器无法捕捉动态情绪变化的问题,提出情绪导向的EmoPatient模拟器,引入情绪指导代理生成动态情绪控制信号,经评估其在情绪真实性指标和稳健性上均优于基线,可提升姑息治疗沟通训练的真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01570 2026-08-04 cs.CL 新提交 86%

Characterizing Treatment-Context Medication Evidence Across Clinic Notes and Structured EHR Medication History

刻画门诊病历与结构化电子健康记录(EHR)药物史中的治疗情境药物证据

Mingyang Jiang, Congning Ni, Weixin Liu, Zhijun Yin

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对门诊病历与结构化EHR药物史的药物信息差异,开发结合LLM、人工审核等的标准化方法,通过患者级测试集验证,明确不匹配原因并提升了药物信息一致性。

Comments 9 pages, 3 figures. Submitted to IEEE BIBM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27558 2026-07-31 cs.CV cs.AI 新提交 86%

Drawing-Recode: Annotation Grounding for Parametric CAD Code Generation from Raster 2D CAD Drawings

Drawing-Recode:基于栅格2D CAD图纸的参数化CAD代码生成的标注定位方法

Mingi Kim, Yongjun Kim, Hyungki Kim

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 Drawing-Recode是一种从栅格2D CAD图纸生成参数化CAD代码的框架,通过图像编码器、文本识别模块、交叉注意力与AGL实现标注定位,性能优于基线且对工业扫描图纸鲁棒,可助力制造自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25471 2026-07-29 cs.AI cs.MM 新提交 86%

TRWH: A Text-Driven Random Walk Heterogeneous GNN for Semantic-Aware Sparse Recommendation

TRWH:用于语义感知稀疏推荐的文本驱动随机游走异构图神经网络

He Ma, Chen Liu

机构 * The University of Sydney(悉尼大学) Nankai University(南开大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对稀疏推荐中整合GNN与LLM优势的挑战,提出TRWH框架,通过随机游走增强融合文本概要与异构图结构,含嵌入创建、异构图神经网络、随机游走路径构建三组件,实验表明其在时尚和美妆数据集上性能远超现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12051 2026-07-15 cs.CL 新提交 86%

Agentic systems for breast cancer treatment recommendations

用于乳腺癌治疗建议的智能体系统

Vinicius Anjos de Almeida, Nícolas Henrique Borges, Leonardo Vicenzi, Helena Kociolek, Sarah Miriã de Castro Rocha, Frederico Nassif Gomes, Júlia Cristina Ferreira Ribeiro, Lucas Emanuel Silva e Oliveira

机构 * Spesia(斯佩西亚) Faculdade de Medicina, Universidade de São Paulo(圣保罗大学医学院) Laboratory of Artificial Intelligence Applied to Bioinformatics, SEPT, Universidade Federal do Paraná (UFPR)(巴拉那联邦大学人工智能应用于生物信息学实验室,SEPT) Pontifícia Universidade Católica do Paraná (PUCPR)(巴拉那天主大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究评估用于乳腺癌治疗建议的智能体LLM系统,用72个真实临床病例和1147个特定病例量表,比较七种流程,最佳配置全局得分为0.594±0.025,工具使用和智能体自主性影响各异,虽能生成相关建议,但用于无监督临床使用仍不足。

Comments Under peer review. Source code available at: https://github.com/GRUPOMED4U/breast_cancer_agents_paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11400 2026-07-14 cs.CL 新提交 86%

Cross-Architecture LLM Ensembles, Feature-Based Reranking and Retrieval-Augmented Prompting for Legal Information Processing

用于法律信息处理的跨架构大语言模型集成、基于特征的重新排序和检索增强提示

Amal Saad Alshehri, Nelly Bencomo, Amir Atapour-Abarghouei

机构 * Durham University(杜伦大学) Jazan University(吉赞大学)

专题命中 领域大模型 :prompting(title,abstract);LLM(title);分类 cs.CL

AI总结 该研究参与COLIEE 2026五项法律信息处理任务,采用开放权重系统。核心方法包括跨架构模型集成、基于特征重新排序及检索增强提示。在多任务中取得不同成果,如法规蕴含任务准确率高,展示了不同方法在不同任务设置下的有效性。

Comments 10 pages. Team DU participation in all five tasks of COLIEE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25879 2026-06-25 cs.DC cs.AI 新提交 86%

AI-Assisted Computational Reproducibility on the FABRIC Testbed

AI辅助计算可复现性在FABRIC试验台上的研究

Komal Thareja, Paul Ruth, Berent Aldikacti, Michael Zink

机构 * RENCI, University of North Carolina at Chapel Hill, NC, USA(RENCI,北卡罗来纳大学教堂山分校) University of Massachusetts Amherst, MA, USA(马萨诸塞大学阿姆赫斯特分校)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 利用FABRIC试验台和LLM编码助手LoomAI,通过三个跨领域案例研究,展示了AI辅助工作流将复现实验的工作量减少约4-6倍,但在分析阶段仍需人工指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24585 2026-06-24 cs.AI 新提交 86%

LLMs Prompted for Legal Context Object More: Overrefusal from Small On-Premises LLMs in Criminal Legal Context

LLMs在刑事法律语境中被提示为法律上下文对象:小型本地LLM的过度拒绝

Anastasiia Kucherenko, François Brouchoud, Dimitri Percia David, Andrei Kucharavy

机构 * IEM, HEG, HES-SO Valais-Wallis(瓦莱州-瓦利斯高等专业学院,管理与工程学院,经济与酒店管理学院)

专题命中 领域大模型 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 研究小型本地LLM在法律提示中的过度拒绝现象,发现权威性前缀(如“国家最高法院助理”)使拒绝率提高2-20倍,而角色扮演前缀效果不一,表明模型在真实机构用户可能引入的上下文框架下不稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18803 2026-06-18 cs.AI cs.CY 新提交 86%

ProfiLLM: Utility-Aligned Agentic User Profiling for Industrial Ride-Hailing Dispatch

ProfiLLM: 面向工业网约车调度的效用对齐智能用户画像

Tengfei Lyu, Zirui Yuan, Xu Liu, Kai Wan, Zihao Lu, Li Ma, Hao Liu

机构 * Didichuxing Co. Ltd(滴滴出行科技有限公司)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ProfiLLM,一种通过工具增强全局知识挖掘和效用对齐画像探索的智能LLM数据管道,解决工业网约车调度中大规模行为日志的用户画像问题,在滴滴生产系统中实现AUC提升6.14%、GMV提升4.35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16003 2026-06-16 cs.AI 新提交 86%

SciText2Eq: Assessing LLMs for Explainable Equation Generation for Scientific Creativity

SciText2Eq: 评估大语言模型在科学创造力中的可解释方程生成

Yifan Mo, Xiao Fu, Yue Su, Qingyu Meng, Koen Hindriks, Qingzhi Liu, Jiahuan Pei

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Wageningen University & Research(瓦赫宁根大学及研究中心)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型从科学文本生成数学方程的能力,构建AI论文数据集,提出可解释方程生成流程,并设计结合自动指标、LLM评估和人工判断的评估协议,发现LLM在语义准确性上表现不足。

Comments Accepted by findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15884 2026-06-16 cs.CL 新提交 86%

Neuron Level Analysis of Large Language Model in Legal Domain Reasoning

法律领域推理中大语言模型的神经元级分析

Eri Onami, Youmi Ma, Shuhei Kurita, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学大学) NII(国立信息学研究所) AIST(产业技术综合研究所)

专题命中 领域大模型 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL

AI总结 通过神经元归因分数识别并抑制关键神经元,发现存在任务特异性神经元和跨任务通用神经元,法律领域神经元重叠度高且分布受输入格式影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15646 2026-06-16 cs.AI 新提交 86%

NeuroSymbolic AI for Legal AI-TRISM: Trustworthy, Reliable, Interpretable, Safe Models

面向法律AI-TRISM的神经符号AI:可信、可靠、可解释、安全模型

Deepa Tilwani, Yash Saxena, Ankur Padia, Srinivasan Parthasarathy, Manas Gaur

机构 * Department of Computer Science, AI Institute, University of South Carolina(南卡罗来纳大学计算机科学系,人工智能研究所) Department of Computer Science and Electrical Engineering, University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校计算机科学与电气工程系) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对法律领域LLM缺乏可解释推理和易产生幻觉的问题,提出TRISM框架,融合神经符号AI与LLM,通过结构化法律知识集成和RAG验证机制提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏