arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-10 至 2026-02-10 共收录 454 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 103 篇

2409.17397 2026-02-10 cs.CL cs.LG 79%

Building Multilingual Datasets for Predicting Mental Health Severity through LLMs: Prospects and Challenges

通过LLMs构建多语言数据集以预测心理健康严重程度:前景与挑战

Konstantinos Skianis, John Pavlopoulos, A. Seza Doğruöz

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过多语言数据集评估LLMs在心理健康严重程度预测中的性能,揭示了多语言环境下模型表现的差异及潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08701 2026-02-10 cs.HC 78%

LLM-Enhanced Wearables for Comprehensible Health Guidance in LMICs

基于大语言模型的增强型可穿戴设备用于低收入国家的可理解健康指导

Mohammad Shaharyar Ahsan, Areeba Shahzad Shaikh, Maham Zahid, Umer Irfan, Maryam Mustafa, Naveed Anwar Bhatti, Muhammad Hamad Alizai

专题命中 评测与基准 :LLM(title,abstract)

AI总结 Guardian Angel通过结合低成本可穿戴设备和基于WhatsApp的LLM代理,提供通俗易懂的健康指导,提升低收入国家用户对健康数据的理解和关注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08298 2026-02-10 cs.RO 78%

Benchmarking Autonomous Vehicles: A Driver Foundation Model Framework

自动驾驶性能评估:一种驾驶员基础模型框架

Yuxin Zhang, Cheng Wang, Hubert P. H. Shum

机构 * National Key Laboratory of Automotive Chassis Integration and Bionics, Jilin University(汽车底盘集成与仿生国家重点实验室,吉林大学) Department of Computer Science, Durham University(杜伦大学计算机科学系) School of Engineering and Physical Sciences, Heriot-Watt University(赫瑞斯泰大学工程与物理科学学院) DRIVEResearch

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出一种驾驶员基础模型框架,用于全面评估自动驾驶车辆的性能,旨在解决安全、舒适和能源经济性等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20487 2026-02-10 cs.RO 78%

A Survey of Behavior Foundation Model: Next-Generation Whole-Body Control System of Humanoid Robots

人形机器人行为基础模型综述:下一代全身体控系统

Mingqi Yuan, Tao Yu, Wenqi Ge, Xiuyong Yao, Huijiang Wang, Jiayu Chen, Bo Li, Wei Zhang, Wenjun Zeng, Hua Chen, Xin Jin

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) LimX Dynamics Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院、东部技术研究所) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) CREATE Lab, EPFL(EPFL CREATE 实验室) School of System Design and Intelligent Manufacturing, Southern University of Science and Technology(南方科技大学系统设计与智能制造学院) ZJU-UIUC Institute, Zhejiang University(浙江大学ZJU-UIUC研究院) INFIFORCE Intelligent Technology Co., Ltd.(INFIFORCE智能科技有限公司)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文综述了人形机器人全身体控中行为基础模型的发展,探讨了其在复杂任务中的应用及未来研究方向。

Comments 19 pages, 10 figures

Journal ref IEEE TRANSACTIONS ON PATTERN ANALYSIS AND MACHINE INTELLIGENCE, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08716 2026-02-10 cs.CL 77%

PERSPECTRA: A Scalable and Configurable Pluralist Benchmark of Perspectives from Arguments

PERSPECTRA: 一种可扩展且可配置的多元视角论证基准

Shangrui Nie, Kian Omoomi, Lucie Flek, Zhixue Zhao, Charles Welch

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PERSPECTRA提出了一种结合结构清晰与语义多样性的多元视角论证基准,用于评估模型在处理多个视角时的表示、区分与推理能力。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08709 2026-02-10 cs.CL 77%

FactSim: Fact-Checking for Opinion Summarization

FactSim: 意见摘要中的事实核查

Leandro Anghinoni, Jorge Sanchez

机构 * MercadoLibre São Paulo, Brazil(巴西圣保罗MercadoLibre) MercadoLibre Cordoba, Argentina(阿根廷 CordobaMercadoLibre)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FactSim提出了一种全自动方法,用于评估意见摘要中生成内容的事实一致性,通过测量摘要声明与原始评论声明的相似性,提高事实核查的准确性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08600 2026-02-10 cs.CL 77%

Beyond Scalar Scores: Reinforcement Learning for Error-Aware Quality Estimation of Machine Translation

超越标量评分:用于机器翻译错误感知质量估计的强化学习

Archchana Sindhujan, Girish A. Koushik, Shenbin Qian, Diptesh Kanojia, Constantin Orăsan

机构 * Institute for People-Centred AI(以人为本的人工智能研究所) University of Surrey(塞弗尔大学) NICE Research Group(NICE研究组) University of Oslo(奥斯陆大学) Centre for Translation Studies(翻译研究中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ALOPE-RL框架,通过强化学习实现基于错误感知的机器翻译质量估计,在低资源语言上取得优异效果。

Comments Currently this article is under review for Natural Language Processing Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08307 2026-02-10 cs.LG stat.ML 77%

Interaction-Grounded Learning for Contextual Markov Decision Processes with Personalized Feedback

基于交互的 contextual Markov 决策过程学习与个性化反馈

Mengxiao Zhang, Yuheng Zhang, Haipeng Luo, Paul Mineiro

机构 * University of Iowa(爱荷华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Southern California(南加州大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种计算高效的算法,用于在具有个性化反馈的上下文性 Markov 决策过程中实现次线性遗憾保证,通过扩展奖励估计器构造并设计逆间隙加权算法,有效提升了多轮交互中学习个性化目标的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03969 2026-02-10 cs.SI cs.AI 77%

Structural shifts in institutional participation and collaboration within the AI arXiv preprint research ecosystem

人工智能arXiv预印本研究生态系统中机构参与与合作的结构性转变

Shama Maganur, Mayank Kejriwal

机构 * ISI

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了AI预印本生态系统中机构参与和合作的结构性变化,发现ChatGPT引入后出版量激增,但学术-产业合作仍处于较低水平。

Comments 16 pages, 5 Figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08133 2026-02-10 cs.SE 75%

Integrating Code Metrics into Automated Documentation Generation for Computational Notebooks

将代码度量纳入计算笔记本的自动化文档生成中

Mojtaba Mostafavi Ghahfarokhi, Hamed Jahantigh, Alireza Asadi, Abbas Heydarnoori

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用代码度量提升计算笔记本自动化文档生成的准确性与相关性,通过两阶段方法验证了代码度量对文档质量的积极影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07960 2026-02-10 cs.CV 75%

D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning

D-ORCA:面向鲁棒音频视觉描述的对话中心优化

Changli Tang, Tianyi Wang, Fengyun Rao, Jing Lyu, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 D-ORCA通过对话中心优化,提升音频视觉描述的鲁棒性和准确性,填补开源生态关键空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07869 2026-02-10 cs.DL 75%

Recall, Risk, and Governance in Automated Proposal Screening for Research Funding: Evidence from a National Funding Programme

回忆、风险与治理在研究资金自动筛选中的作用:来自国家资金计划的证据

Chandan G. Nagarajappa, Moumita Koley, Avinash Kumar, Rabindra Panigrahy, Pramod Kumar Arya

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了自动化筛选系统在研究资金申请中的表现,发现基于规则的方法在召回率和假阴性控制上优于基于大型语言模型的方法。

Comments 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04464 2026-02-10 cs.DL 75%

In which fields do ChatGPT scores align better than citations with research quality?

在哪些领域中ChatGPT的评分比引用更符合研究质量?

Mike Thelwall

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 ChatGPT-4o和ChatGPT-5 mini在多个领域中表现出比引用更高的研究质量相关性,为新研究质量评估提供了有力证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04605 2026-02-10 cs.CV cs.AI cs.LG eess.IV 73%

Reproducible Benchmarking for Lung Nodule Detection and Malignancy Classification Across Multiple Low-Dose CT Datasets

多低剂量CT数据集上的肺结节检测与恶性分类可重复基准测试

Fakrul Islam Tushar, Avivah Wang, Lavsen Dahal, Ehsan Samei, Michael R. Harowicz, Jayashree Kalpathy-Cramer, Kyle J. Lafata, Tina D. Tailor, Cynthia Rudin, Joseph Y. Lo

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多数据集基准测试,评估不同数据集上肺结节检测和恶性分类模型的性能,发现数据集特性显著影响AI性能。

Comments 3 tables, 2 supplement tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07852 2026-02-10 cs.AI cs.CL 73%

Emergent Misalignment is Easy, Narrow Misalignment is Hard

涌现的偏移是容易的,狭窄的偏移是困难的

Anna Soligo, Edward Turner, Senthooran Rajamanoharan, Neel Nanda

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,大型语言模型在狭窄有害数据集上微调易产生偏移,但一般偏移更稳定高效,通过线性表示和KL损失实现,为监控和缓解偏移提供方法。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07562 2026-02-10 cs.LG cs.AI stat.ML 73%

Gaussian Match-and-Copy: A Minimalist Benchmark for Studying Transformer Induction

高斯匹配与复制:一种研究Transformer归纳的极简基准

Antoine Gonon, Alexandre Cordonnier, Nicolas Boumal

机构 * Institute of Mathematics, EPFL, Switzerland(数学研究所,瑞士联邦理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出高斯匹配与复制基准,用于研究Transformer的匹配与复制机制,通过隔离长距离检索信号,分析模型在检索能力上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00765 2026-02-10 cs.AI 70%

HouseTS: A Large-Scale, Multimodal Spatiotemporal U.S. Housing Dataset and Benchmark

HouseTS:一个大规模、多模态的美国住房时空数据集和基准

Shengkun Wang, Yanshen Sun, Fanglan Chen, Linhan Wang, Naren Ramakrishnan, Chang-Tien Lu, Yinlin Chen

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 评测与基准 :LLM(abstract);foundation model(abstract);分类 cs.AI

AI总结 HouseTS是一个大规模多模态美国住房时空数据集,用于提供长期房价预测的基准,涵盖超过6000个邮政编码的月度数据,并支持多种模型的评估与可解释性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07978 2026-02-10 cs.CL 70%

Cross-Linguistic Persona-Driven Data Synthesis for Robust Multimodal Cognitive Decline Detection

跨语言人格驱动的数据合成用于鲁棒多模态认知衰退检测

Rui Feng, Zhiyao Luo, Liuyu Wu, Wei Wang, Yuting Song, Yong Liu, Kok Pin Ng, Jianqing Li, Xingyao Wang

机构 * Engineering Research Center of Intelligent Theranostics Technology and Instruments, Ministry of Education, School of Biomedical Engineering and Informatics, Nanjing Medical University(智能诊疗技术与仪器工程研究中心、教育部、生物医学工程与信息学院、南京医科大学) Institute of Biomedical Engineering, University of Oxford(生物医学工程研究所、牛津大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所、科技研究局(A*STAR)) Department of Neurology, National Neuroscience Institute, Singapore, 308433, Singapore(神经病学部、新加坡国家神经科学研究所) Duke-NUS Medical School, Singapore, 169857, Singapore(新加坡国立大学医学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SynCog通过跨语言人格驱动数据合成与推理链微调,提升多模态模型在认知衰退检测中的诊断性能和跨语言泛化能力。

Comments 18 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07361 2026-02-10 cs.CL cs.IR 70%

ViHERMES: A Graph-Grounded Multihop Question Answering Benchmark and System for Vietnamese Healthcare Regulations

ViHERMES: 一个基于图的多跳问答基准和系统用于越南卫生法规

Long S. T. Nguyen, Quan M. Bui, Tin T. Ngo, Quynh T. N. Vo, Dung N. H. Le, Tho T. Quan

机构 * URA Research Group, Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), VNU-HCM, Vietnam(URA研究组,计算机科学与工程学院,胡志明市技术大学(HCMUT),VNU-HCM,越南)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ViHERMES是一个针对越南医疗法规多跳问答的基准和系统,通过图感知方法提升法规问答性能。

Comments Accepted at ACIIDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05929 2026-02-10 cs.CL 70%

KV-CoRE: Benchmarking Data-Dependent Low-Rank Compressibility of KV-Caches in LLMs

KV-CoRE: 对LLMs中KV缓存数据依赖性低秩压缩性的基准测试

Jian Chen, Zhuoran Wang, Jiayu Qin, Ming Li, Meng Wang, Changyou Chen, Yin Chen, Qizhen Weng, Yirui Liu

机构 * University at Buffalo(布法罗大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Delft University of Technology(代尔夫特理工大学) University of Maryland(马里兰大学) ByteDance(字节跳动)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 KV-CoRE提出了一种基于SVD的KV缓存压缩性评估方法,通过分析模型架构、训练数据和语言覆盖等因素,揭示了压缩性与性能下降之间的关系,为数据驱动的压缩和模型开发提供了新的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01829 2026-02-10 cs.LG 70%

RealPDEBench: A Benchmark for Complex Physical Systems with Real-World Data

RealPDEBench: 一个整合真实世界数据的复杂物理系统基准

Peiyan Hu, Haodong Feng, Hongyuan Liu, Tongtong Yan, Wenhao Deng, Tianrun Gao, Rong Zheng, Haoren Zheng, Chenglei Yu, Chuanrui Wang, Kaiwen Li, Zhi-Ming Ma, Dezhi Zhou, Xingcai Lu, Dixia Fan, Tailin Wu

机构 * School of Engineering, Westlake University(西湖大学工程学院) Global College, Shanghai Jiao Tong University(上海交通大学全球学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Department of Geotechnical Engineering, Tongji University(同济大学地质工程系) School of Physics, Peking University(北京大学物理学院) Key Laboratory for Power Machinery and Engineering of M. O. E., Shanghai Jiao Tong University(上海交通大学机械工程重点实验室)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 RealPDEBench通过整合真实世界数据与模拟数据,为科学机器学习提供了一个新的基准,旨在弥合仿真与现实之间的差距。

Comments iclr26 oral; 46 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16813 2026-02-10 cs.CL 70%

Cognitive Linguistic Identity Fusion Score (CLIFS): A Scalable Cognition-Informed Approach to Quantifying Identity Fusion from Text

认知语言身份融合评分(CLIFS):一种可扩展的认知导向方法,用于从文本中量化身份融合

Devin R. Wright, Jisun An, Yong-Yeol Ahn

机构 * Center for Complex Networks and Systems Research, Luddy School of Informatics, Computing, and Engineering, Indiana University Bloomington(复杂网络与系统研究中心,信息学、计算与工程学院,印第安纳大学布卢明顿分校) Cognitive Science Program, Indiana University Bloomington(认知科学项目,印第安纳大学布卢明顿分校) School of Data Science, University of Virginia(数据科学学院,弗吉尼亚大学) CulturePulse, Inc.(CulturePulse公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CLIFS通过整合认知语言学与大语言模型,提供一种自动化方法来量化文本中的身份融合,有效提升暴力风险评估的准确性。

Comments Authors' accepted manuscript (postprint; camera-ready). To appear in the Proceedings of EMNLP 2025. Pagination/footer layout may differ from the Version of Record

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21083 2026-02-10 cs.AI 70%

OpenSec: Measuring Incident Response Agent Calibration Under Adversarial Evidence

OpenSec: 在对抗性证据下评估事件响应代理的校准

Jarrod Barnes

机构 * Jarrod Barnes

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OpenSec通过双控制强化学习环境评估事件响应代理在对抗性证据下的校准能力,发现前沿模型存在过度触发问题,校准差距体现在克制而非检测。

Comments 7 pages, 3 figures, 3 tables. Code: https://github.com/jbarnes850/opensec-env. Dataset: https://huggingface.co/datasets/Jarrodbarnes/opensec-seeds

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08828 2026-02-10 cs.CV 67%

VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning

VideoVeritas:通过感知预设强化学习实现AI生成视频检测

Hao Tan, Jun Lan, Senyuan Shi, Zichang Tan, Zijian Yu, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 VideoVeritas通过感知预设强化学习提升AI生成视频检测性能,整合细粒度感知与事实推理,采用时空定位和自监督计数提升检测效果。

Comments Project: https://github.com/EricTan7/VideoVeritas

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08194 2026-02-10 cs.LG cs.AI cs.CL 67%

Dreaming in Code for Curriculum Learning in Open-Ended Worlds

代码梦驱动开放世界中的课程学习

Konstantinos Mitsides, Maxence Faldor, Antoine Cully

机构 * Department of Computing, Imperial College London(帝国理工学院计算机系)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DiCode通过生成可执行环境代码,解决开放世界中持续学习的挑战,实现长周期技能提升。

Comments 11 pages (main text), 90 pages total. Project page: https://konstantinosmitsides.github.io/dreaming-in-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07379 2026-02-10 cs.CR cs.MA 67%

Aegis: Towards Governance, Integrity, and Security of AI Voice Agents

Aegis:面向AI语音代理治理、完整性和安全性的研究

Xiang Li, Pin-Yu Chen, Wenqi Wei

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Aegis提出了一种针对AI语音代理治理、完整性和安全性的红队框架,通过系统性评估揭示了语音代理在行为攻击方面的脆弱性,强调了分层防御的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08796 2026-02-10 cs.AI cs.CL 62%

The Use of AI Tools to Develop and Validate Q-Matrices

利用AI工具开发和验证Q矩阵

Kevin Fan, Jacquelyn A. Bialo, Hongli Li

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨AI工具在Q矩阵开发与验证中的应用,发现Google Gemini 2.5 Pro在协议程度上优于人类专家,但后续更新版本表现下降。

Comments An earlier version of this study was presented at the Psychometric Society Meeting held in July 2025 in Minneapolis, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08149 2026-02-10 cs.CL cs.AI 62%

DIAL-SUMMER: A Structured Evaluation Framework of Hierarchical Errors in Dialogue Summaries

DIAL-SUMMER:一种评估对话摘要中分层错误的结构化框架

Sahana Ramnath, Nima Chitsazan, Mingyang Zhou, Chia-Hsuan Lee, Shi-Xiong Zhang, Stephen Rawls, Sambit Sahu, Sangwoo Cho, Xiang Ren, Genta Indra Winata, Akshaj Kumar Veldanda

机构 * University of Southern California(美国南加州大学) Capital One

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 DIAL-SUMMER提出一种结构化框架,用于评估对话摘要中分层错误,通过细粒度错误分类和实证分析揭示摘要生成的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05713 2026-02-10 cs.CL cs.AI 62%

DRAGOn: Designing RAG On Periodically Updated Corpus

DRAGOn:设计一个定期更新语料库的RAG基准测试

Fedor Chernogorskii, Sergei Averkiev, Liliya Kudraleeva, Zaven Martirosian, Maria Tikhonova, Valentin Malykh, Alena Fenogenova

机构 * SberAI MBZUAI ITMO MISIS HSE University(俄罗斯高等经济大学) MWS AI IITU(俄罗斯联邦信息技术大学) YSDA

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 DRAGOn通过定期更新的语料库设计RAG基准测试,提供自动问题生成和评估流程,减少数据泄漏并促进社区参与。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06975 2026-02-10 cs.CL cs.AI 62%

BiomechAgent: AI-Assisted Biomechanical Analysis Through Code-Generating Agents

BiomechAgent: 通过代码生成代理实现AI辅助的生物力学分析

R. James Cotton, Thomas Leonard

机构 * Shirley Ryan AbilityLab Northwestern University(Shirley Ryan AbilityLab 北卡罗来纳大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 BiomechAgent通过自然语言和代码生成技术,使无标记运动捕捉数据的生物力学分析更易被非编程用户使用,提升临床应用的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏