arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32459 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32459 篇

2601.00224 2026-01-08 cs.CL cs.SE 85%

Talk Less, Verify More: Improving LLM Assistants with Semantic Checks and Execution Feedback

少说多查:通过语义检查和执行反馈改进LLM助手

Yan Sun, Ming Cai, Stanley Kok

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Q*和Feedback+两种验证技术,通过语义检查和执行反馈提升LLM助手的输出准确性与可靠性。

Comments WITS 2025 (Workshop on Information Technologies and Systems 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03359 2026-01-08 cs.AI 85%

Enhancing LLM Instruction Following: An Evaluation-Driven Multi-Agentic Workflow for Prompt Instructions Optimization

增强大语言模型指令遵循:一种以评估为导向的多智能体工作流用于提示指令优化

Alberto Purpura, Li Wang, Sahil Badyal, Eugenio Beaufrand, Adam Faulkner

机构 * Card Intelligence, Capital One(卡德智能,Capital One)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种多智能体工作流,通过评估驱动的方法优化提示指令,提升大语言模型对约束条件的遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20278 2026-01-08 cs.CL 85%

Quantifying LLM Biases Across Instruction Boundary in Mixed Question Forms

量化混合问题形式中跨指令边界的LLM偏见

Zipeng Ling, Shuliang Liu, Yuehao Tang, Chen Huang, Gaoyang Jiang, Shenghong Fu, Junqi Yang, Yao Wan, Jiawan Zhang, Kejia Huang, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Pennsylvania(宾夕法尼亚大学) Huazhong University of Science and Technology(华中科技大学) Hong Kong Polytechnic University(香港理工大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出BiasDetector基准,用于评估LLM在混合问题形式数据集下对稀疏标签混合的识别能力,揭示用户指令对LLM偏见的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03194 2026-01-07 cs.CL 85%

X-MuTeST: A Multilingual Benchmark for Explainable Hate Speech Detection and A Novel LLM-consulted Explanation Framework

X-MuTeST:一个用于可解释仇恨言论检测的多语言基准及一种新颖的LLM咨询解释框架

Mohammad Zia Ur Rehman, Sai Kartheek Reddy Kasu, Shashivardhan Reddy Koppula, Sai Rithwik Reddy Chirra, Shwetank Shekhar Singh, Nagendra Kumar

机构 * Indian Institute of Technology Indore(印度理工学院Indore) Indian Institute of Information Technology Dharwad(印度信息科技学院Dharwad) Arizona State University(亚利桑那州立大学) Indian Institute of Technology Mandi(印度理工学院Mandi)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 X-MuTeST提出一种结合LLM和传统技术的多语言仇恨言论检测框架,通过人类注释的解释提升分类性能和可解释性。

Comments Accepted in the proceedings of AAAI 2026

Journal ref AAA 2026 (AISI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00912 2026-01-06 cs.IR cs.AI 85%

The Discovery Gap: How Product Hunt Startups Vanish in LLM Organic Discovery Queries

发现鸿沟:产品猎奇初创企业如何在LLM有机发现查询中消失

Amit Prakash Sharma

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现,初创企业在LLM有机发现查询中难以被识别,传统SEO信号比AI优化更有效。

Comments 20 pages, 7 figures. Based on M.Tech thesis research, Indian Institute of Technology Patna, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00596 2026-01-05 cs.CL 85%

Beyond IVR: Benchmarking Customer Support LLM Agents for Business-Adherence

超越IVR:评估符合业务规范的客户支持LLM代理的基准测试

Sumanth Balaji, Piyush Mishra, Aashraya Sachdeva, Suraj Agrawal

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出JourneyBench基准测试,用于评估客户支持中遵循业务政策的LLM代理,展示动态提示代理在提升政策遵循度方面的有效性。

Comments 17 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00509 2026-01-05 cs.CR cs.LG 85%

Improving LLM-Assisted Secure Code Generation through Retrieval-Augmented-Generation and Multi-Tool Feedback

通过检索增强生成和多工具反馈改进LLM辅助的安全代码生成

Vidyut Sriram, Sawan Pandita, Achintya Lakshmanan, Aneesh Shamraj, Suman Saha

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过检索增强生成和多工具反馈,改进LLM辅助的安全代码生成,显著减少安全漏洞和缺陷率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25055 2026-01-01 cs.AI cs.HC 85%

Context-aware LLM-based AI Agents for Human-centered Energy Management Systems in Smart Buildings

面向人类中心的基于大语言模型的AI代理用于智能建筑中的能源管理系统

Tianzhi He, Farrokh Jazizadeh

机构 * organization= School of Civil \& Environmental Engineering Construction Management, The University of Texas at San Antonio , addressline= BSE 1.310, One UTSA Circle , city= San Antonio , postcode= 78249 , state= TX , country= U.S. organization= Department of Civil Environmental Engineering, Virginia Polytechnic Institute State University , addressline= 200 Patton Hall, 750 Drillfield , city= Blacksburg , postcode= 24060 , state= VA , country= U.S.

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出基于大语言模型的AI代理,用于智能建筑中的人类中心能源管理,通过自然语言交互实现情境感知的能源优化与管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21635 2026-01-01 cs.CL 85%

Heaven-Sent or Hell-Bent? Benchmarking the Intelligence and Defectiveness of LLM Hallucinations

天降还是地狱?评估大语言模型幻觉的智能与缺陷

Chengxu Yang, Jingling Yuan, Siqi Cai, Jiawei Jiang, Chuang Hu

机构 * Wuhan University of Technology(武汉理工大学) Hubei Key Laboratory of Transportation Internet of Things(湖北省交通运输物联网重点实验室) BreathingCORE Wuhan University(武汉大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出HIC-Bench框架,通过分类智能与缺陷幻觉,评估LLM在创造力与准确性之间的平衡,揭示幻觉对科学创新的推动作用。

Comments Published as a conference paper at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04235 2026-01-01 cs.CL 85%

Addressing Hallucinations with RAG and NMISS in Italian Healthcare LLM Chatbots

通过RAG和NMISS解决意大利医疗LLM聊天机器人中的幻觉

Maria Paola Priola

机构 * Department of Economics and Business, University of Cagliari(经济与商业系,卡利亚里大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过RAG和NMISS方法有效缓解和检测LLM中的幻觉问题,验证了GPT-4和NMISS对提升医疗领域LLM性能的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22470 2025-12-30 cs.AI 85%

DarkPatterns-LLM: A Multi-Layer Benchmark for Detecting Manipulative and Harmful AI Behavior

DarkPatterns-LLM: 一种多层基准用于检测操纵性和有害的AI行为

Sadia Asif, Israel Antonio Rosales Laguan, Haris Khan, Shumaila Asif, Muneeb Asif

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) National University of Sciences and Technology(国立科学与技术大学) School of Electrical Engineering & Computer Science(电子与计算机科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DarkPatterns-LLM提出了一种多层基准用于检测LLM中的操纵性行为,通过细粒度分析和专家标注,评估七个危害类别下的内容,揭示模型在自主性检测方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00592 2025-12-30 cs.PL cs.DC cs.LG cs.PF 85%

Agentic Auto-Scheduling: An Experimental Study of LLM-Guided Loop Optimization

代理自调度:LLM引导循环优化的实验研究

Massinissa Merouani, Islem Kara Bernou, Riyadh Baghdadi

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ComPilot框架,利用LLM与编译器闭环交互实现代码优化,实验表明其在循环优化中效果优于现有方法。

Comments Accepted at the 34th International Conference on Parallel Architectures and Compilation Techniques (PACT 2025). 12 pages, plus appendix

Journal ref 2025 34th International Conference on Parallel Architectures and Compilation Techniques (PACT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21236 2025-12-25 cs.CR cs.AI cs.SE 85%

Casting a SPELL: Sentence Pairing Exploration for LLM Limitation-breaking

为LLM突破限制而探索句子配对:恶意代码生成的测试框架

Yifan Huang, Xiaojun Jia, Wenbo Guo, Yuqiang Sun, Yihao Huang, Chong Wang, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SPELL框架通过智能句子配对探索LLM在恶意代码生成中的安全漏洞,有效提升对抗测试效果。

Comments Accepted to FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21127 2025-12-25 cs.AI 85%

A Real-World Evaluation of LLM Medication Safety Reviews in NHS Primary Care

对NHS初级医疗中基于LLM的药物安全审查系统的真实世界评估

Oliver Normand, Esther Borsi, Mitch Fruin, Lauren E Walker, Jamie Heagerty, Chris C. Holmes, Anthony J Avery, Iain E Buchan, Harry Coppock

机构 * i.AI, Department for Science, Innovation, and Technology(i.AI,科学、创新与技术部门) Centre for Experimental Therapeutics, University of Liverpool(实验治疗中心,利物浦大学) Civic Health Innovation Labs, University of Liverpool(公民健康创新实验室,利物浦大学) Downing Street(唐宁街10号) Department of Statistics, University of Oxford(统计系,牛津大学) Ellison Institute of Technology(埃利森技术研究所) Centre for Academic Primary Care, University of Nottingham(学术初级护理中心,诺丁汉大学) The UK AI Security Institute(英国人工智能安全研究所) Department of Computing, Imperial College London(计算系,伦敦帝国学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了基于LLM的药物安全审查系统在真实临床数据中的表现,揭示了其在不同复杂性下的失败模式,强调了上下文推理的重要性及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11822 2025-12-25 cs.AI 85%

Beyond Consensus: Mitigating the Agreeableness Bias in LLM Judge Evaluations

超越共识:在LLM评估中缓解顺从偏差

Suryaansh Jain, Umair Z. Ahmed, Shubham Sahai, Ben Leong

机构 * University of Massachusetts at Amherst(马萨诸塞大学阿默斯特分校) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于回归的框架,通过少量人工标注数据建模验证者偏差,有效缓解LLM评估中的顺从偏差问题,并在代码反馈任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18940 2025-12-23 cs.CL cs.SE 85%

FASTRIC: Prompt Specification Language for Verifiable LLM Interactions

FASTRIC:用于可验证大语言模型交互的提示规范语言

Wen-Long Jin

机构 * Department of Civil and Environmental Engineering(土木与环境工程系) California Institute for Telecommunications and Information Technology(电信与信息科技学院) Institute of Transportation Studies(交通研究学院) University of California, Irvine, CA 92697-3600(加州大学伊维德分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FASTRIC通过显式化有限状态机构建可验证的大语言模型交互协议,揭示模型特定的规范正式程度范围,实现交互设计的系统化工程。

Comments 13 pages, 3 figures. Supplementary materials at https://doi.org/10.17605/OSF.IO/PV6R3

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18755 2025-12-23 cs.AI 85%

MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking

MEEA: 基于mere exposure效应的对抗性优化用于LLM jailbreaking

Jianyi Zhang, Shizhao Liu, Ziyin Zhou, Zhen Li

机构 * Beijing Electronic Science and Technology Institute(北京电子科技研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MEEA通过基于mere exposure效应的对抗性优化,提升LLM jailbreaking的攻击成功率,揭示LLM安全行为的动态性和历史依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14121 2025-12-22 cs.CV cs.AI 85%

SportsGPT: An LLM-driven Framework for Interpretable Sports Motion Assessment and Training Guidance

SportsGPT: 一种基于大语言模型的可解释性体育动作评估与训练指导框架

Wenbo Tian, Ruting Lin, Hongxian Zheng, Yaodong Yang, Geng Wu, Zihao Zhang, Zhang Zhang

机构 * School of Artificial Intelligence, UCAS, Beijing, China(人工智能学院) MAIS, NLPR, Institute of Automation, CAS, Beijing, China(自动化研究所) College of Education, Beijing Sport University, Beijing, China(北京体育大学) KuTi Sports Technology, Shaanxi, China(KuTi体育科技) Haoxiong Technology, Shanghai, China(浩鸿科技)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SportsGPT通过结合大语言模型和运动分析技术,实现可解释的体育动作评估与专业训练指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10689 2025-12-22 cs.CL 85%

Learning to Contextualize Web Pages for Enhanced Decision Making by LLM Agents

通过LLM代理增强决策的网页上下文化学习

Dongjun Lee, Juyong Lee, Kyuyoung Kim, Jihoon Tack, Jinwoo Shin, Yee Whye Teh, Kimin Lee

机构 * KAIST AI(韩国科学技术院人工智能实验室) University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LCoW通过上下文化学习提升LLM代理在网页自动化任务中的决策能力,显著提高闭源和开源模型的成功率。

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14285 2025-12-18 cs.CR cs.LG 85%

A Multi-Agent LLM Defense Pipeline Against Prompt Injection Attacks

针对提示注入攻击的多智能体LLM防御管道

S M Asif Hossain, Ruksat Khan Shayoni, Mohd Ruhul Ameen, Akif Islam, M. F. Mridha, Jungpil Shin

机构 * School of Computing, Wichita State University, Kansas, USA(威斯康星州立大学计算机学院) College of Engineering and Computer Sciences, Marshall University, Huntington, WV, USA(马歇尔大学工程与计算机科学学院) Department of Computer Science and Engineering, University of Rajshahi, Bangladesh(拉贾沙希大学计算机科学与工程系) Department of Computer Science and Engineering, American International University-Bangladesh, Dhaka, Bangladesh(美国国际大学-孟加拉国计算机科学与工程系) School of Computer Science and Engineering, The University of Aizu, Aizuwakamatsu, Japan(立命馆大学计算机科学与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种多智能体防御框架,通过协调的LLM代理实时检测并中和提示注入攻击,显著提升了安全性和系统功能。

Comments Accepted at the 11th IEEE WIECON-ECE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20764 2025-12-18 cs.CL 85%

Feel the Difference? A Comparative Analysis of Emotional Arcs in Real and LLM-Generated CBT Sessions

感知差异?真实与LLM生成CBT对话中情感弧的比较分析

Xiaoyi Wang, Jiwei Zhang, Guangtao Zhang, Honglei Guo

机构 * Department of Computer Science, Shantou University(汕头大学计算机科学系) Department of Automation, Tsinghua University(清华大学自动化系) BNRIST, Tsinghua University(清华大学脑科学与类脑智能研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过比较真实与LLM生成的CBT对话,揭示了合成对话在情感动态上的不足,强调了情感真实性的关键作用。

Comments Accepted at 2025 EMNLP findings,19 page,2 figures

Journal ref In Findings of the Association for Computational Linguistics: EMNLP 2025, pages 19999-20017

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14846 2025-12-18 cs.CR cs.AI 85%

MALCDF: A Distributed Multi-Agent LLM Framework for Real-Time Cyber

MALCDF: 一种用于实时网络防御的分布式多智能体大语言模型框架

Arth Bhardwaj, Sia Godika, Yuvam Loonker

机构 * Saint Francis High School(圣弗朗西斯高中) Massachusetts Institute of Technology(麻省理工学院) JBCN International School(JBCN国际学校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MALCDF通过协调多个LLM智能体实现高准确率的实时网络防御,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08743 2025-12-17 cs.AI cs.MA 85%

Single-Agent Scaling Fails Multi-Agent Intelligence: Towards Foundation Models with Native Multi-Agent Intelligence

单智能体扩展无法实现多智能体智能:迈向具有原生多智能体智能的基础模型

Shuyue Hu, Haoyang Yan, Yiqun Zhang, Yang Chen, Dongzhan Zhou, Lei Bai

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文指出单智能体扩展无法实现多智能体智能,提出构建具有原生多智能体智能的基础模型的关键方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23260 2025-12-16 cs.CR cs.AI 85%

From Prompt Injections to Protocol Exploits: Threats in LLM-Powered AI Agents Workflows

从提示注入到协议利用:LLM驱动的AI代理工作流中的威胁

Mohamed Amine Ferrag, Norbert Tihanyi, Djallel Hamouda, Leandros Maglaras, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(阿联酋大学计算机与网络工程系) Technology Innovation Institute(技术创新研究所) Eötvös Loránd University(埃奥瓦大学) Department of Computer Science, Guelma University(古尔马大学计算机科学系) De Montfort University(德蒙福特大学) Khalifa University of Science and Technology(卡里玛科学技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种统一的端到端威胁模型,系统分类了LLM代理生态系统中的三十多种攻击技术,涵盖输入操纵、模型妥协、系统和隐私攻击及协议漏洞,并提供缓解策略以设计安全的代理AI系统。

Comments The paper is published in ICT Express (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25540 2025-12-16 cs.AI 85%

RadOnc-GPT: An Autonomous LLM Agent for Real-Time Patient Outcomes Labeling at Scale

RadOnc-GPT:一种用于大规模实时患者结果标注的自主大语言模型代理

Jason Holmes, Yuexing Hao, Mariana Borras-Osorio, Federico Mastroleo, Santiago Romero Brufau, Valentina Carducci, Katie M Van Abel, David M Routman, Andrew Y. K. Foong, Liv M Muller, Satomi Shiraishi, Daniel K Ebner, Daniel J Ma, Sameer R Keole, Samir H Patel, Mirek Fatyga, Martin Bues, Brad J Stish, Yolanda I Garces, Michelle A Neben Wittich, Robert L Foote, Sujay A Vora, Nadia N Laack, Mark R Waddle, Wei Liu

机构 * Mayo Clinic, Phoenix, AZ, USA(梅奥诊所,凤凰城,亚利桑那州,美国) Mayo Clinic, Rochester, MN, USA(梅奥诊所,罗切斯特,明尼苏达州,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RadOnc-GPT是一种自主大语言模型代理,通过自主检索和评估实现大规模实时患者结果标注,提升放射肿瘤学研究的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03859 2025-12-12 cs.CL 85%

Anthropocentric bias in language model evaluation

语言模型评估中的人本偏见

Raphaël Millière, Charles Rathkopf

机构 * University of Oxford(牛津大学) Forschungszentrum Jülich(尤利希研究中心)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 本文指出语言模型评估中存在人本偏见,提出通过结合行为实验与机制研究来减少这些偏见,以更准确评估模型能力。

Comments Published in Computational Linguistics

Journal ref Computational Linguistics, 1-10. (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08934 2025-12-11 cs.HC cs.AI 85%

Motion2Meaning: A Clinician-Centered Framework for Contestable LLM in Parkinson's Disease Gait Interpretation

Motion2Meaning: 一种以临床为中心的可挑战LLM框架,用于帕金森病步态解读

Loc Phuc Truong Nguyen, Hung Thanh Do, Hung Truong Thanh Nguyen, Hung Cao

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) University of New Brunswick(新 Brunswick大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Motion2Meaning通过结合可解释AI和可挑战LLM,为帕金森病步态解读提供透明、可审计的临床系统。

Comments Accepted at the 9th International Symposium on Chatbots and Human-Centered AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07501 2025-12-09 cs.SE cs.AI 85%

AutoICE: Automatically Synthesizing Verifiable C Code via LLM-driven Evolution

AutoICE: 通过LLM驱动的进化自动合成可验证的C代码

Weilin Luo, Xueyi Liang, Haotian Deng, Yanan Liu, Hai Wan

机构 * Sun Yat-sen University, School of Computer Science and Engineering(中山大学计算机科学与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AutoICE通过LLM驱动的进化搜索方法,自动合成可验证的C代码,验证成功率高达90.36%,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06228 2025-12-09 cs.CL 85%

Policy-based Sentence Simplification: Replacing Parallel Corpora with LLM-as-a-Judge

基于政策的句子简化:用LLM作为评判者取代平行语料库

Xuanxin Wu, Yuki Arase, Masaaki Nagata

机构 * The University of Osaka(大阪大学) Institute of Science Tokyo(东京科学研究所) NTT Inc.(日本电报电话公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出利用LLM作为评判者自动构建政策一致的训练数据,实现无需人工标注或平行语料库的句子简化系统,实验表明其在词法简化和整体重写任务上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05336 2025-12-08 cs.LG 85%

PathFinder: MCTS and LLM Feedback-based Path Selection for Multi-Hop Question Answering

PathFinder: 基于MCTS和LLM反馈的多跳问答路径选择

Durga Prasad Maram, Kalpa Gunaratna, Vijay Srinivasan, Haris Jeelani, Srinivas Chappidi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PATHFINDER通过MCTS和LLM反馈优化多跳问答的路径选择,提升训练数据质量与推理准确性。

Comments 5 PAGES, 3 IMAGES

详情

展开后加载摘要…

URL PDF HTML 收藏