arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-15 至 2026-01-15 共收录 31 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31 篇

2510.08942 2026-01-15 cs.CL 89%

SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures

SOP-Maze:在复杂业务标准操作规程上评估大语言模型

Jiaming Wang, Zhe Tang, Zehao Jin, Hefei Chen, Yilin Jin, Peng Ding, Xiaoyu Li, Xuezhi Cao

机构 * Meituan M17(美团M17) Georgia Institute of Technology(佐治亚理工学院) Nanjing University(南京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 SOP-Maze通过评估大语言模型在复杂业务标准操作规程中的表现,揭示了模型在遵循规程、对话处理和计算推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16685 2026-01-15 cs.CL 88%

Structured yet Bounded Temporal Understanding in Large Language Models

结构化但有界的大型语言模型时间理解

Damin Zhang, Julia Rayz

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过对比指示性与顺序性时间框架,揭示了大型语言模型在不同时间参考结构下对时间表示的组织方式及影响其时间理解的关键因素。

Comments Under review. Results on larger dataset. Correct a theoretical error. 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08183 2026-01-15 cs.CV cs.AI 88%

GI-Bench: A Panoramic Benchmark Revealing the Knowledge-Experience Dissociation of Multimodal Large Language Models in Gastrointestinal Endoscopy Against Clinical Standards

GI-Bench: 一个全景基准测试,揭示多模态大语言模型在内窥镜检查中与临床标准相比的知识-经验脱节

Yan Zhu, Te Luo, Pei-Yao Fu, Zhen Zhang, Zi-Long Wang, Yi-Fan Qu, Zi-Han Geng, Jia-Qi Xu, Lu Yao, Li-Yun Ma, Wei Su, Wei-Feng Chen, Quan-Lin Li, Shuo Wang, Ping-Hong Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 GI-Bench通过评估多模态大语言模型在胃肠内窥镜中的性能,揭示其在诊断推理和空间定位方面的不足,发现模型在语言流畅度上优于人类,但事实准确性较低。

Comments 45 pages, 17 figures, 6 tables. Leaderboard available at: https://roterdl.github.io/GIBench/ . Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08312 2026-01-15 cs.HC cs.CL 88%

Word Synchronization Challenge: A Benchmark for Word Association Responses for Large Language Models

词同步挑战:一种用于大型语言模型词关联响应的基准测试

Tanguy Cazalets, Joni Dambre

机构 * Ghent University(根特大学) Airo lab(Airo实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出词同步挑战基准测试,用于评估大型语言模型在模拟人类认知过程中的词关联能力,揭示模型复杂性对社交互动性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09626 2026-01-15 cs.LG cs.AI cs.SY eess.SY 87%

From Prompt to Protocol: Fast Charging Batteries with Large Language Models

从提示到协议:利用大语言模型实现快速充电电池

Ge Lei, Ferran Brosa Planella, Sterling G. Baird, Samuel J. Cooper

机构 * Dyson School of Design Engineering, Imperial College London(帝国理工学院伦敦设计工程学院) University of Warwick(沃里克大学) Acceleration Consortium, University of Toronto(多伦多大学加速联盟)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 利用大语言模型设计快速充电电池协议,通过Prompt-to-Optimizer和Prompt-to-Protocol方法提升充电效率和电池健康状态

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05984 2026-01-15 cs.AI cs.CL cs.HC 86%

Development and Evaluation of HopeBot: an LLM-based chatbot for structured and interactive PHQ-9 depression screening

HopeBot的开发与评估:一种基于大语言模型的聊天机器人,用于结构化和互动的PHQ-9抑郁筛查

Zhijun Guo, Alvina Lai, Julia Ive, Alexandru Petcu, Yutong Wang, Luyuan Qi, Johan H Thygesen, Kezhi Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HopeBot利用大语言模型实现结构化和互动的PHQ-9抑郁筛查,展示出作为可扩展筛查工具的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08835 2026-01-15 cs.CL cs.AI 86%

DeliberationBench: When Do More Voices Hurt? A Controlled Study of Multi-LLM Deliberation Protocols

DeliberationBench: 当更多声音有害时?多LLM协商协议的受控研究

Vaarunay Kaushal, Taranveer Singh

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DeliberationBench研究发现,多LLM协商协议在性能上远低于简单基线,挑战了复杂性提升质量的假设。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09250 2026-01-15 cs.CL 85%

When to Invoke: Refining LLM Fairness with Toxicity Assessment

何时触发:通过毒性评估提升LLM公平性

Jing Ren, Bowen Li, Ziqi Xu, Renqiang Luo, Shuo Yu, Xin Ye, Haytham Fayek, Xiaodong Li, Feng Xia

机构 * RMIT University(拉筹纳斯大学) Jilin University(吉林大学) Dalian University of Technology(大连理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FairToT通过推理时的提示引导毒性评估,提升LLM在不同群体间的公平性,减少群体差异并保持预测稳定性。

Comments Accepted by Findings of WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06821 2026-01-15 cs.CL cs.AI cs.SE 82%

Can LLMs Generate Reliable Test Case Generators? A Study on Competition-Level Programming Problems

LLMs能否生成可靠的测试用例生成器?对竞赛级编程问题的研究

Yuhan Cao, Zian Chen, Kun Quan, Ziliang Zhang, Yu Wang, Xiaoning Dong, Yeqi Feng, Guanzhong He, Jingcheng Huang, Jianhao Li, Yixuan Tan, Jiafu Tang, Yilin Tang, Junlei Wu, Qianyu Xiao, Can Zheng, Shouchen Zhou, Yuxiang Zhu, Yiming Huang, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海启智研究院) ShanghaiTech University(上海科技大学) Wuhan University(武汉大学) Fuzhou University(福州大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Nanjing University(南京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究LLMs在生成竞赛级编程问题测试用例生成器方面的能力,提出TCGBench基准测试,并通过实验发现LLMs在生成针对性测试用例以暴露代码缺陷方面存在不足。

Comments 37 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03471 2026-01-15 cs.CL cs.CY cs.LG 82%

Template-Based Probes Are Imperfect Lenses for Counterfactual Bias Evaluation in LLMs

基于模板的探测器在评估大语言模型中的反事实偏见时是不完美的透镜

Farnaz Kohankhaki, D. B. Emerson, Jacob-Junqi Tian, Laleh Seyyed-Kalantari, Faiza Khan Khattak

机构 * Vector Institute(向量研究所) York University(约克大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本研究发现基于模板的探测器在评估大语言模型中的反事实偏见时存在系统性扭曲,需更严谨的方法以区分真实偏见与语言惯例影响。

Comments 22 Pages, 6 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09367 2026-01-15 cs.CL 81%

Relation Extraction Capabilities of LLMs on Clinical Text: A Bilingual Evaluation for English and Turkish

大型语言模型在临床文本中关系抽取能力的评估:英语和土耳其语的双语评估

Aidana Aidynkyzy, Oğuz Dikenelli, Oylum Alatlı, Şebnem Bora

机构 * Department of Computer Engineering, Astana IT University(阿斯塔纳IT大学计算机工程系) Department of Computer Engineering, Ege University(埃兹尔大学计算机工程系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过双语评估揭示了LLM在临床文本关系抽取中的能力,提出Relation-Aware Retrieval方法,展示其在英语和土耳其语中的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09387 2026-01-15 cs.CL cs.AI cs.CY 79%

Truth Knows No Language: Evaluating Truthfulness Beyond English

真理无语言:超越英语的真理性评估

Blanca Calvo Figueras, Eneko Sagarzazu, Julen Etxaniz, Jeremy Barnes, Pablo Gamallo, Iria de-Dios-Flores, Rodrigo Agerri

机构 * HiTZ Center - Ixa, University of the Basque Country, UPV/EHU(希茨中心-ixa,巴斯克大学,UPV/EHU) Elhuyar(埃尔胡亚尔) Centro de Investigación en Tecnoloxías Intelixentes (CiTIUS), Universidade de Santiago de Compostela(智能技术研究中心(CiTIUS),圣地亚哥-德孔波斯特拉大学) Departament de Traducció i Ciències del Llenguatge, Universitat Pompeu Fabra(翻译与语言科学部门,庞培法布拉大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过专业翻译扩展TruthfulQA基准,评估多语言大型语言模型的真理性,发现机器翻译可作为替代方案,且通用知识问题在多语言中表现更佳。

Comments 14 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13291 2026-01-15 cs.CL cs.AI 79%

Higher Satisfaction, Lower Cost: A Technical Report on How LLMs Revolutionize Meituan's Intelligent Interaction Systems

更高满意度,更低成本:关于LLMs如何革新美团智能交互系统的技术报告

Xuxin Cheng, Ke Zeng, Zhiquan Cao, Linyi Dai, Wenxuan Gao, Fei Han, Ai Jian, Feng Hong, Wenxing Hu, Zihe Huang, Dejian Kong, Jia Leng, Zhuoyuan Liao, Pei Liu, Jiaye Lin, Xing Ma, Jingqing Ruan, Jiaxing Song, Xiaoyu Tan, Ruixuan Xiao, Wenhui Yu, Wenyu Zhan, Haoxing Zhang, Chao Zhou, Hao Zhou, Shaodong Zheng, Ruinian Chen, Siyuan Chen, Ziyang Chen, Yiwen Dong, Yaoyou Fan, Yangyi Fang, Yang Gan, Shiguang Guo, Qi He, Chaowen Hu, Binghui Li, Dailin Li, Xiangyu Li, Yan Li, Chengjian Liu, Xiangfeng Liu, Jiahui Lv, Qiao Ma, Jiang Pan, Cong Qin, Chenxing Sun, Wen Sun, Zhonghui Wang, Abudukelimu Wuerkaixi, Xin Yang, Fangyi Yuan, Yawen Zhu, Tianyi Zhai, Jie Zhang, Runlai Zhang, Yao Xu, Yiran Zhao, Yifan Wang, Xunliang Cai, Yangen Hu, Cao Liu, Lu Pan, Xiaoli Wang, Bo Xiao, Wenyuan Yao, Qianlin Zhou, Benchang Zhu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 美团通过WOWService技术报告,利用LLMs和多智能体架构提升智能交互系统,实现用户满意度提升和成本降低。

Comments 36 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07234 2026-01-15 cs.HC cs.IR stat.AP 78%

Making Absence Visible: The Roles of Reference and Prompting in Recognizing Missing Information

使缺失信息可见:参考和提示在识别缺失信息中的作用

Hagit Ben Shoshan, Joel Lanir, Pavel Goldstein, Osnat Mokryn

专题命中 评测与基准 :prompting(title,abstract)

AI总结 研究探讨了参考框架和提示如何影响用户识别数据中预期但缺失信息的能力,发现基于样本的参考和提示能提升缺失检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09029 2026-01-15 cs.CR cs.AI 77%

Proactively Detecting Threats: A Novel Approach Using LLMs

主动检测威胁:一种利用大语言模型的新方法

Aniesh Chawla, Udbhav Prasad

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型主动识别网络威胁,通过评估多个模型在提取指标 compromises 方面的性能,展示Gemini 1.5 Pro在精度和特异性上的优越表现。

Comments 2025 International Conference on Cyber-Enabled Distributed Computing and Knowledge Discovery (CyberC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09382 2026-01-15 cs.AI cs.CL 73%

Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments

长期任务导向代理:动态环境中主动的长期意图维护

Qinglong Shi, Donghai Wang, Hantao Zhou, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * School of Management, University of Science and Technology of China(中国科学技术大学管理学院) Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种主动任务导向代理,通过意图条件监控和事件触发跟进,提升动态环境中长期意图维护的能力,并通过ChronosBench验证了其有效性。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09089 2026-01-15 cs.CL cs.AI 73%

SubTokenTest: A Practical Benchmark for Real-World Sub-token Understanding

SubTokenTest: 一个用于现实世界子token理解的实用基准

Shuyang Hou, Yi Hu, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SubTokenTest通过实用任务评估大语言模型在子token理解上的能力,揭示分词过程对性能的影响,并分析字符级信息的编码方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08892 2026-01-15 cs.CL cs.AI 73%

Evaluating Role-Consistency in LLMs for Counselor Training

评估LLM在辅导培训中的角色一致性

Eric Rudolph, Natalie Engert, Jens Albrecht

机构 * Technische Hochschule Nürnberg Georg Simon Ohm(图林根应用技术大学纽伦堡乔治·西蒙·奥姆学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过引入对抗性数据集评估LLM在辅导培训中的角色一致性,比较了Vicuna与其他开源模型的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20224 2026-01-15 cs.CL 72%

Can Editing LLMs Inject Harm?

能否通过编辑LLM注入危害?

Canyu Chen, Baixiang Huang, Zekun Li, Zhaorun Chen, Shiyang Lai, Xiongxiao Xu, Jia-Chen Gu, Jindong Gu, Huaxiu Yao, Chaowei Xiao, Xifeng Yan, William Yang Wang, Philip Torr, Dawn Song, Kai Shu

机构 * Northwestern University(西北大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL;LLM(comments)

AI总结 本文提出编辑攻击作为LLM安全威胁,揭示了通过编辑注入虚假信息和偏见的风险及高隐蔽性。

Comments Accepted to Proceedings of AAAI 2026. The first two authors contributed equally. 7 pages for main paper, 31 pages including appendix. The code, results, dataset for this paper and more resources are on the project website: https://llm-editing.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09613 2026-01-15 cs.CV cs.AI 70%

CogRail: Benchmarking VLMs in Cognitive Intrusion Perception for Intelligent Railway Transportation Systems

CogRail: 对智能铁路运输系统中认知入侵感知的视觉语言模型进行基准测试

Yonglin Tian, Qiyao Zhang, Wei Xu, Yutong Wang, Yihao Wu, Xinyi Li, Xingyuan Dai, Hui Zhang, Zhiyong Cui, Baoqing Guo, Zujun Yu, Yisheng Lv

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Signal & Communication Research Institute, China Academy of Railway Sciences(信号与通信研究所,中国铁路科学研究院) Beijing Huairou Academy of Parallel Sensing(北京怀柔平行感知院) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(智能交通系统国家重点实验室,交通科学与工程学院,北京航空航天大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 CogRail提出一个用于评估视觉语言模型在认知入侵感知任务中性能的基准,通过联合微调框架提升模型在时空推理和威胁分析中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09017 2026-01-15 cs.CL 70%

Multicultural Spyfall: Assessing LLMs through Dynamic Multilingual Social Deduction Game

多文化间谍迷局:通过动态多语言社交推理解谜游戏评估LLM

Haryo Akbarianto Wibowo, Alaa Elsetohy, Qinrong Cui, Alham Fikri Aji

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过动态多语言社交推理解谜游戏Spyfall评估LLM的多语言和多文化能力,发现非英语环境下模型表现较弱,提供了一种更稳健的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08849 2026-01-15 cs.CL 70%

Gaming the Answer Matcher: Examining the Impact of Text Manipulation on Automated Judgment

利用答案匹配器:考察文本操纵对自动判断的影响

Manas Khatore, Sumana Sridharan, Kevork Sulahian, Benjamin J. Smith, Shi Feng

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 研究通过测试文本操纵对自动答案匹配的影响,发现其对模型评分鲁棒,且在有参考答案时可作为替代评估方法。

Comments Accepted to the AAAI 2026 Workshop on AI Governance (AIGOV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08676 2026-01-15 cs.AI 70%

Advancing ESG Intelligence: An Expert-level Agent and Comprehensive Benchmark for Sustainable Finance

推进ESG智能:一个专家级代理和全面的可持续金融基准

Yilei Zhao, Wentao Zhang, Lei Xiao, Yandan Zheng, Mengpu Liu, Wei Yang Bryan Lim

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ESGAgent多代理系统及三级基准,通过高准确率在原子问题回答和专业报告生成中超越现有LLMs,为可持续金融领域提供关键评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09603 2026-01-15 cs.SD cs.AI cs.CL cs.LG 67%

Linear Complexity Self-Supervised Learning for Music Understanding with Random Quantizer

基于随机量化器的线性复杂度自监督学习用于音乐理解

Petros Vavaroutsos, Theodoros Palamas, Pantelis Vikatos

机构 * Orfium Research(奥菲姆研究)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种结合Branchformer和SummaryMixing的自监督学习方法,通过随机量化减少模型规模,实现音乐理解任务中的高效性能。

Comments accepted by ACM/SIGAPP Symposium on Applied Computing (SAC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07235 2026-01-15 cs.IT math.IT 67%

Sentiment Analysis on Movie Reviews: A Deep Dive into Modern Techniques and Open Challenges

对电影评论的情感分析:深入探讨现代技术和开放挑战

Agnivo Gosai, Shuvodeep De, Karun Thankachan, Ramadan A. ZeinEldin, Ali W. Mohamed, Seyed J. Mousavirad

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文综述了电影评论情感分析的现代技术和挑战,涵盖从传统方法到深度学习模型的发展,并探讨了多模态分析、可解释性及未来研究方向。

Comments 31 Pages; 1 figure; 108 references; paper under review in APIN

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07309 2026-01-15 cs.CL 57%

Agent Bain vs. Agent McKinsey: A New Text-to-SQL Benchmark for the Business Domain

Agent Bain vs. Agent McKinsey:业务领域的新文本到SQL基准测试

Yue Li, Ran Tao, Derek Hommel, Yusuf Denizay Dönder, Sungyong Chang, David Mimno, Unso Eun Seo Jo

机构 * Cornell University(康奈尔大学) Gena AI

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 CORGI是一个新的文本到SQL基准测试,旨在评估业务领域中更复杂的问题,如预测和推荐,揭示LLM在处理复杂任务时的性能下降。

Comments 23 pages, under review for ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11773 2026-01-15 cs.CL 57%

AgenticIE: An Adaptive Agent for Information Extraction from Complex Regulatory Documents

AgenticIE: 一种用于从复杂监管文件中提取信息的自适应代理

Gaye Colakoglu, Gürkan Solmaz, Jonathan Fürst

机构 * Zurich University of Applied Sciences(苏黎世应用科学大学) NEC Laboratories Europe(NEC欧洲实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出AgenticIE系统,用于从复杂监管文件中提取信息和回答问题,通过高密度标注数据集验证其在KIE和QA任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15854 2026-01-15 cs.CV cs.LG 57%

Privacy-Preserving in Connected and Autonomous Vehicles Through Vision to Text Transformation

通过视觉到文本转换实现连接和自动驾驶车辆中的隐私保护

Abdolazim Rezaei, Mehdi Sookhak, Ahmad Patooghy, Shahab S. Band, Amir Mosavi

机构 * organization= Department of Computre Science, Texas A\&M University Corpus Christi , addressline= 6300 Ocean Dr , city= Corpus Christi , postcode= 78412 , state= Texas , country= USA organization= Department of Information Management, International Graduate School of Artificial Intelligence, National Yunlin University of Science organization= Institute of the Information Society, Ludovika University of Public Service , city= Budapest , postcode= 78412 , country= Hungary organization= North Carolina A\&T State University , addressline= 601 E Market , city= Greensboro , postcode= 27411 , country= USA

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出利用强化学习和视觉-语言模型,通过视觉到文本转换实现对连接和自动驾驶车辆中敏感视觉信息的隐私保护,提升了隐私保护效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04083 2026-01-15 cs.CL 57%

A Benchmark for End-to-End Zero-Shot Biomedical Relation Extraction with LLMs: Experiments with OpenAI Models

一个用于基于LLM的端到端零样本生物医学关系抽取的基准:使用OpenAI模型进行实验

Aviv Brokman, Xuguang Ai, Yuhang Jiang, Shashank Gupta, Ramakanth Kavuluru

机构 * Division of Biomedical Informatics(生物医学信息学系) Department of Internal Medicine(内科部) University of Kentucky(肯塔基大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出一个基于LLM的端到端零样本生物医学关系抽取基准,评估了OpenAI模型在不同数据集上的表现,发现其在部分数据集上接近监督方法,但在复杂输入上仍有不足。

Comments Accepted to appear in proceedings of the 3rd Workshop on Artificial Intelligence for Scientific Publications (WASP@AACL 2025). Code and data are available here: https://github.com/bionlproc/ZeroShotRE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09163 2026-01-15 cs.RO 50%

CEI: A Unified Interface for Cross-Embodiment Visuomotor Policy Learning in 3D Space

CEI:一种用于3D空间跨身体视觉运动策略学习的统一接口

Tong Wu, Shoujie Li, Junhao Gong, Changqing Guo, Xingting Li, Shilong Mu, Wenbo Ding

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 CEI提出了一种跨身体视觉运动策略学习框架,通过功能相似性量化和梯度优化实现不同机械臂和末端执行器间的演示转移,实验显示在模拟和现实任务中均取得高转移效率。

详情

展开后加载摘要…

URL PDF HTML 收藏