arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-27 至 2025-11-27 共收录 167 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 29 篇

2505.18955 2025-11-27 cs.AI cs.CR cs.SE 70%

Co-PatcheR: Collaborative Software Patching with Component(s)-specific Small Reasoning Models

Co-PatcheR: 基于组件特定小推理模型的协作软件修补

Yuheng Tang, Hongwei Li, Kaijie Zhu, Michael Yang, Yangruibo Ding, Wenbo Guo

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Co-PatcheR通过组件特定的小推理模型实现协作软件修补,提升修补效率并减少训练资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00396 2025-11-27 cs.CV 67%

Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning

Saliency-R1: 通过置信度引导的强化学习激励多模态大语言模型统一的显著性推理能力

Long Li, Shuichen Ji, Ziyang Luo, Zhihui Li, Dingwen Zhang, Junwei Han, Nian Liu

机构 * Northwestern Polytechnical University(西北工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 Saliency-R1通过置信度引导的强化学习,提升多模态大语言模型在显著性推理任务中的统一能力,实现显著物体检测、显著实例分割和共显著物体检测的高效处理。

Comments Main text (excluding references): 8 pages, 4 figures; Supplementary Materials (excluding references): 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20701 2025-11-27 cs.AI cs.LG 62%

Cross Domain Evaluation of Multimodal Chain-of-Thought Reasoning of different datasets into the Amazon CoT Framework

跨领域评估不同数据集的多模态链式推理在Amazon CoT框架中的表现

Nitya Tiwari, Parv Maheshwari, Vidisha Agarwal

机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了多模态链式推理在不同数据集上的表现,发现视觉整合减少幻觉但不同问题类型对推理有效性影响显著,为多模态推理系统改进提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15848 2025-11-27 cs.AI cs.CL cs.SD 62%

Step-Audio-R1 Technical Report

Step-Audio-R1 技术报告

Fei Tian, Xiangyu Tony Zhang, Yuxin Zhang, Haoyang Zhang, Yuxin Li, Daijiao Liu, Yayue Deng, Donghang Wu, Jun Chen, Liang Zhao, Chengyuan Yao, Hexin Liu, Eng Siong Chng, Xuerui Yang, Xiangyu Zhang, Daxin Jiang, Gang Yu

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 Step-Audio-R1 是首个实现音频领域推理能力的模型,通过MGRD框架生成基于声音特征的推理链,超越Gemini 2.5 Pro并达到Gemini 3 Pro水平。

Comments 22 pages, 5 figures. Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21460 2025-11-27 cs.AI 57%

MADRA: Multi-Agent Debate for Risk-Aware Embodied Planning

MADRA:多智能体辩论用于风险感知的具身规划

Junjian Wang, Lidan Zhao, Xi Sheryl Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) University of Chinese Academy of Sciences, Nanjing(中国科学院大学南京校区)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 MADRA通过多智能体辩论和分层认知框架,在安全性和效率上超越现有方法,实现高安全任务拒绝率和低误拒率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20994 2025-11-27 cs.CV cs.AI cs.CR 57%

GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision

GuardTrace-VL: 通过迭代安全监督检测不安全的多模型推理

Yuxiao Xiang, Junchi Chen, Zhenchao Jin, Changtao Miao, Haojie Yuan, Qi Chu, Tao Gong, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络安全学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 GuardTrace-VL通过联合图像-文本分析监控多模态推理全过程,有效检测不安全推理内容,实现93.1%的F1分数提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19900 2025-11-27 cs.CV cs.AI 57%

Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning

Agent0-VL: 探索自我进化代理用于工具集成的视觉-语言推理

Jiaqi Liu, Kaiwen Xiong, Peng Xia, Yiyang Zhou, Haonian Ji, Lu Feng, Siwei Han, Mingyu Ding, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理与问题求解 :language agent(abstract);分类 cs.AI

AI总结 Agent0-VL通过工具集成推理实现自我进化,无需人类标注或外部奖励,提升视觉-语言推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17490 2025-11-27 cs.CV 50%

Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination

Video-R4:通过视觉沉思强化文本丰富的视频推理

Yolo Y. Tang, Daiki Shimada, Hang Hua, Chao Huang, Jing Bi, Rogerio Feris, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Sony Group Corporation(索尼集团) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 推理与问题求解 :SFT(abstract)

AI总结 Video-R4通过视觉沉思机制提升文本丰富视频的推理能力,采用多阶段学习框架实现像素基础的多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18509 2025-11-27 cs.PL 50%

Higher-Order Behavioural Conformances via Fibrations

通过纤维化实现更高阶的行为一致性

Henning Urbat

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出了一种统一的范畴方法,通过纤维化实现高阶语言的行为一致性,证明了最大行为一致性在一般条件下的合同性质。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 37 篇

2511.19872 2025-11-27 cs.AI 90%

Simulated Self-Assessment in Large Language Models: A Psychometric Approach to AI Self-Efficacy

大语言模型的模拟自我评估:一种心理测量方法用于AI自我效能

Daniel I Jackson, Emma L Jensen, Syed-Amad Hussain, Emre Sezgin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文通过心理测量方法评估大语言模型的自我效能,发现模型自我评估与实际表现不一致,且不同任务表现差异显著。

Comments 25 pages,5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15585 2025-11-27 cs.SE cs.CL cs.PL 90%

Leveraging Test Driven Development with Large Language Models for Reliable and Verifiable Spreadsheet Code Generation: A Research Framework

利用大型语言模型进行测试驱动开发以实现可靠且可验证的电子表格代码生成:一种研究框架

Simon Thorne, Advait Sarkar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出一种结合测试驱动开发与大型语言模型的框架,以提高电子表格代码生成的可靠性与准确性。

Comments 16 pages

Journal ref Proceedings of the EuSpRIG 2025 Conference "Spreadsheet Productivity & Risks" ISBN : 978-1-905404-60-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01219 2025-11-27 cs.CL cs.AI 90%

Uncovering Implicit Bias in Large Language Models with Concept Learning Dataset

通过概念学习数据集揭示大型语言模型中的隐性偏见

Leroy Z. Wang

机构 * UPLB(菲律宾大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文通过概念学习数据集揭示大型语言模型在量化词上的隐性偏见,并展示上下文概念学习在发现隐藏偏见中的有效性。

Comments Presented at EurIPS 2025 Workshop - Unifying Perspectives on Learning Biases (UPLB) https://sites.google.com/view/towards-a-unified-view

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21568 2025-11-27 cs.CL 89%

RoParQ: Paraphrase-Aware Alignment of Large Language Models Towards Robustness to Paraphrased Questions

RoParQ:面向抗 paraphrased 问题的大型语言模型对齐

Minjoon Choi

机构 * Seoul National University(首尔国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.CL

AI总结 RoParQ 通过引入 XParaCon 指标和基于推理的 SFT 策略,提升 LLM 在 paraphrased 问题上的鲁棒性与一致性。

Comments 12 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09474 2025-11-27 cs.SE cs.AI cs.OS 89%

MigGPT: Harnessing Large Language Models for Automated Migration of Out-of-Tree Linux Kernel Patches Across Versions

MigGPT:利用大语言模型实现跨版本的Linux内核非官方补丁自动化迁移

Pucheng Dang, Di Huang, Dong Li, Kang Chen, Yuanbo Wen, Qi Guo, Xing Hu

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 MigGPT通过新颖的代码指纹结构和三个精心设计的模块,提高非官方内核补丁迁移的准确性和效率,平均完成率达74.07。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09606 2025-11-27 cs.CR 89%

How Can We Effectively Use LLMs for Phishing Detection?: Evaluating the Effectiveness of Large Language Model-based Phishing Detection Models

如何有效利用大语言模型进行钓鱼检测?:评估基于大语言模型的钓鱼检测模型的有效性

Fujiao Ji, Doowon Kim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文评估了基于大语言模型的钓鱼检测有效性,发现商业模型在检测中表现更优,截图输入在品牌识别中效果最佳,但需注意温度设置和多模态输入的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20703 2025-11-27 cs.CY cs.AI cs.LG 88%

PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach

PropensityBench: 通过代理方法评估大语言模型中的潜在安全风险

Udari Madhushani Sehwag, Shayan Shabihi, Alex McAvoy, Vikash Sehwag, Yuancheng Xu, Dalton Towers, Furong Huang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 PropensityBench通过模拟危险能力评估大语言模型的潜在安全风险倾向,揭示模型在压力下可能选择高风险行为的倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21339 2025-11-27 cs.CV cs.AI 88%

SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding

SurgMLLMBench: 一个用于手术场景理解的多模态大语言模型基准数据集

Tae-Min Choi, Tae Kyeong Jeong, Garam Kim, Jaemin Lee, Yeongyoon Koh, In Cheul Choi, Jae-Ho Chung, Jong Woong Park, Juyoun Park

机构 * Samsung Research(三星研究所) Center for Humanoid Research, Korea Institute of Science and Technology(人类研究学院,韩国科学技术院) Department of plastic surgery, College of medicine, Korea University(医学院整形外科部,韩国大学) Department of orthopedic surgery, College of medicine, Korea University(医学院骨科部,韩国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 SurgMLLMBench是一个用于手术场景理解的多模态大语言模型基准数据集,整合了像素级分割和结构化VQA注释,支持跨领域的全面评估和更丰富的视觉-对话交互。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13693 2025-11-27 cs.CL 88%

Evaluating Large Language Models for Radiology Natural Language Processing

评估大型语言模型用于放射学自然语言处理

Zhengliang Liu, Tianyang Zhong, Yiwei Li, Yutong Zhang, Yi Pan, Zihao Zhao, Peixin Dong, Chao Cao, Yuxiao Liu, Peng Shu, Yaonai Wei, Zihao Wu, Chong Ma, Jiaqi Wang, Sheng Wang, Mengyue Zhou, Zuowei Jiang, Chunlin Li, Jason Holmes, Shaochen Xu, Lu Zhang, Haixing Dai, Kai Zhang, Lin Zhao, Yuanhao Chen, Xu Liu, Peilong Wang, Junhao Chen, Pingkun Yan, Jun Liu, Bao Ge, Lichao Sun, Dajiang Zhu, Xiang Li, Wei Liu, Xiaoyan Cai, Xintao Hu, Xi Jiang, Shu Zhang, Xin Zhang, Tuo Zhang, Shijie Zhao, Quanzheng Li, Hongtu Zhu, Dinggang Shen, Tianming Liu

机构 * School of Biomedical Engineering, ShanghaiTech University(上海科技大学生物医学工程学院) Shanghai Clinical Research and Trial Center(上海临床研究与试验中心) School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) Institute of Medical Research, Northwestern Polytechnical University(西北工业大学医学研究所) School of Life Science and Technology, University of Electronic Science and Technology of China(电子科技大学生命科学与技术学院) Glasgow College, University of Electronic Science and Technology of China(电子科技大学格拉斯哥学院) Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯理工大学计算机科学与工程系) Lingang Laboratory, Shanghai(上海灵冈实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究评估32个大型语言模型在解读放射学报告中的能力,以改进放射学自然语言处理的应用

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04231 2025-11-27 cs.LG cs.AI 86%

Empowering Time Series Forecasting with LLM-Agents

用LLM代理增强时间序列预测

Chin-Chia Michael Yeh, Vivian Lai, Uday Singh Saini, Xiran Fan, Yujie Fan, Junpeng Wang, Xin Dai, Yan Zheng

机构 * Visa Research(Visa研究)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 DCATS通过提升数据质量而非模型架构,为时间序列预测的AutoML提供了新的方法,实现了平均6%的误差减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20683 2025-11-27 cs.CL 81%

Dynamic Template Selection for Output Token Generation Optimization: MLP-Based and Transformer Approaches

动态模板选择用于输出标记生成优化:基于MLP和Transformer的方法

Bharadwaj Yadavalli

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出动态模板选择方法,通过MLP和Transformer路由策略优化输出标记生成,实现成本降低与响应质量的平衡。

Comments 20 pages, 4 figures, includes production-scale experiments across OpenAI GPT-4, Google Gemini, and Anthropic Claude; code available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20403 2025-11-27 cs.SE cs.AI 81%

LLMs for Automated Unit Test Generation and Assessment in Java: The AgoneTest Framework

基于大型语言模型的Java自动化单元测试生成与评估:AgoneTest框架

Andrea Lops, Fedelucio Narducci, Azzurra Ragone, Michelantonio Trizio, Claudio Bartolini

机构 * University of Bari, Bari, Italy(巴里大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 AgoneTest框架通过标准化评估流程,评估大型语言模型生成的Java单元测试质量,展示其在覆盖率和缺陷检测上的表现,并探讨提示策略对测试质量的影响。

Comments Accepted at 40th IEEE/ACM International Conference on Automated Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20783 2025-11-27 cs.CL 79%

On The Role of Pretrained Language Models in General-Purpose Text Embeddings: A Survey

在预训练语言模型中通用文本嵌入的作用:综述

Meishan Zhang, Xin Zhang, Xinping Zhao, Shouzheng Huang, Baotian Hu, Min Zhang

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文综述了预训练语言模型在通用文本嵌入中的作用,探讨了其架构、核心方法及未来研究方向。

Comments 45 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07908 2025-11-27 eess.IV cs.AI cs.CV 79%

ONCOPILOT: A Promptable CT Foundation Model For Solid Tumor Evaluation

ONCOPILOT:一种可提示的CT基础模型用于实体肿瘤评估

Léo Machado, Hélène Philippe, Élodie Ferreres, Julien Khlaut, Julie Dupuis, Korentin Le Floch, Denis Habip Gatenyo, Pascal Roux, Jules Grégory, Maxime Ronot, Corentin Dancette, Tom Boeken, Daniel Tordjman, Pierre Manceron, Paul Hérent

机构 * Raidium, Paris Biotech Santé(Raidium,巴黎生物医疗健康) AP-HP. Nord, Department of Radiology, FHU MOSAIC, Beaujon Hospital(AP-HP. Nord,放射科,FHU MOSAIC,贝琼医院) Université Paris Cité(巴黎城市大学) Université Paris Cité, AP-HP, Hôpital Européen Georges Pompidou, Department of Vascular and Oncological Interventional Radiology(巴黎城市大学,AP-HP,欧文·庞皮杜医院,血管和肿瘤介入放射科) Department of Radiology, Hôpital Cochin, AP-HP(放射科,克里克医院,AP-HP) Centre d’Imagerie du Nord(北影像中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 ONCOPILOT是一种基于CT的可提示基础模型,通过交互式分割提升肿瘤评估精度,实现放射科医生级别的RECIST测量和体积生物标志物分析。

Journal ref npj Precis. Onc. 9, 121 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21624 2025-11-27 cs.SI cs.CL 77%

TAGFN: A Text-Attributed Graph Dataset for Fake News Detection in the Age of LLMs

TAGFN:一种用于LLMs时代虚假新闻检测的文本属性图数据集

Kay Liu, Yuwei Han, Haoyan Xu, Henry Peng Zou, Yue Zhao, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TAGFN是一种用于虚假新闻检测的文本属性图数据集,旨在评估传统和基于LLM的图异常检测方法,并促进LLMs的虚假信息检测能力发展。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20652 2025-11-27 cs.HC cs.AI cs.CY 77%

When LLMs Can't Help: Real-World Evaluation of LLMs in Nutrition

当LLM无法帮助:在营养领域的LLM实证评估

Karen Jia-Hui Li, Simone Balloccu, Ondrej Dusek, Ehud Reiter

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理学院) Saarland University(萨尔兰州大学) TU Darmstadt(图宾根大学) University of Aberdeen(阿伯丁大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过实证研究揭示了LLM在营养领域应用中的实际效果与内在评估之间的差距,指出需采用跨学科方法改进LLM的应用。

Comments Published at INLG 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20090 2025-11-27 cs.AR cs.AI 77%

R3A: Reliable RTL Repair Framework with Multi-Agent Fault Localization and Stochastic Tree-of-Thoughts Patch Generation

R3A:一种可靠的RTL修复框架,结合多智能体故障定位和随机树状思维补丁生成

Zizhang Luo, Fan Cui, Kexing Zhou, Runlin Guo, Mile Xia, Hongyuan Hou, Yun Liang

机构 * Peking University(北京大学) Beihang University(北航)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 R3A通过多智能体故障定位和随机树状思维补丁生成方法,有效提高了RTL修复的可靠性,修复率高达90.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23610 2025-11-27 cs.CL cs.CY 77%

Evaluating the Simulation of Human Personality-Driven Susceptibility to Misinformation with LLMs

评估基于人类人格驱动的易受虚假信息影响的模拟

Manuel Pratelli, Marinella Petrocchi

机构 * IMT School for Advanced Studies Lucca(IMT高级研究学院卢塞拉)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估了LLM在模拟基于人格特质的易受虚假信息影响方面的有效性,发现某些人格特质与虚假信息的关联可被复制,但其他情况存在系统偏差,揭示了LLM在人格建模中的潜力与局限。

Comments pre-print version - paper actually under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21380 2025-11-27 cs.SE 75%

Multi-Agent Systems for Dataset Adaptation in Software Engineering: Capabilities, Limitations, and Future Directions

多智能体系统在软件工程数据集适应中的应用:能力、限制与未来方向

Jingyi Chen, Xiaoyan Guo, Songqiang Chen, Shing-Chi Cheung, Jiasi Shen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了多智能体系统在软件工程数据集适应中的能力与限制,发现提示干预能显著提升适应效果,为未来更可靠的智能体发展提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19123 2025-11-27 cs.HC cs.CY 75%

Facilitating the Integration of LLMs Into Online Experiments With Simple Chat

促进LLMs融入在线实验的简易聊天

R. Bermudez Schettino, A. Dasmeh, L. Brinkmann

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Simple Chat通过简化LLMs整合流程,提升在线实验的生态效度和实验控制,助力人与LLM交互研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14914 2025-11-27 cs.CV cs.CL cs.LG 73%

CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness

CAPability: 一个全面的视觉描述基准,用于评估正确性和全面性

Zhihang Liu, Chen-Wei Xie, Bin Wen, Feiwu Yu, Jixuan Chen, Pandeng Li, Boqiang Zhang, Nianzu Yang, Yinglu Li, Zuan Gao, Yun Zheng, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 CAPability是一个全面的视觉描述基准,通过12个维度评估描述的正确性和全面性,利用人类标注数据和启发式指标提升多模态模型的描述能力分析。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏