arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3102 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3102 篇

2606.25871 2026-06-25 cs.IR cs.AI 新提交 57%

AutoRelAnnotator: Calibrated Model Cascades for Cost-Efficient Relevance Evaluation in Sponsored Search

AutoRelAnnotator: 用于赞助搜索中成本高效的相关性评估的校准模型级联

Md Omar Faruk Rokon, Shasvat Desai, Hong Yao, Kuang-chih Lee

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出校准模型级联方法,通过路由查询至逐步增大的微调分类器,在保持高准确率的同时降低计算成本,实现大规模离线相关性标注。

Comments Accepted at E-commerce workshop, SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25306 2026-06-25 cs.CV cs.AI 新提交 57%

Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

物理问题场景图:文本到视频生成中物理合理性的细粒度评估

Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) AI2(艾伦人工智能研究所) Johns Hopkins University(约翰霍普金斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出物理问题场景图(PQSG),一种基于层次化问题的评估流程,通过图结构问题检查视频在对象、动作和物理规律上的忠实度,实现细粒度评估。

Comments ECCV 2026. Code and data: https://github.com/atinpothiraj/pqsg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25246 2026-06-25 cs.CV cs.CL 新提交 57%

Multilingual Hematology Visual Question Answering Dataset

多语言血液学视觉问答数据集

Hajra Malik, Hafiza Tooba Aftab, Abdul Rehman, Mohsen Ali, Waqas Sultani

机构 * Information Technology University, Lahore(拉合尔信息技术大学) King Edward Medical University, Lahore(拉合尔爱德华国王医科大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 针对医疗领域多语言视觉问答资源匮乏的问题,构建了双语(英语-乌尔都语)血液学VQA基准WBCMor VQA,包含11万问答对和2万细胞图像,并评估了多个开源视觉语言模型。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25761 2026-06-25 cs.LG math.OC 新提交 57%

Bridging Spherical Black-Box Optimizers

桥接球形黑箱优化器

Johannes Ackermann, Stefano Peluchetti

机构 * The University of Tokyo(东京大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 将进化策略、共识优化和积分优化统一为理论框架,通过引入混合优化器控制平坦偏好和模态,在连续控制和语言模型合并任务中提升性能与鲁棒性。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24648 2026-06-24 cs.SD cs.CL eess.AS 新提交 57%

ParaPairAudioBench: Paralinguistic Pairwise Audio Benchmark for LALM-as-a-Judge

ParaPairAudioBench: 面向LALM-as-a-Judge的副语言成对音频基准

Jisu Jeon, Seungyeon Jwa, Joosung Lee, Jinhyeon Kim, Woojin Chung, Hwiyeol Jo, Jeonghoon Kim, Jonghyun Choi, Soyoon Kim

机构 * Hongik University(弘益大学) Seoul National University(首尔大学) NAVER Cloud(NAVER云) KAIST(韩国科学技术院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出ParaPairAudioBench,包含5,175对音频,覆盖风格、语速、重音、年龄和性别五个副语言维度,用于评估大型音频语言模型作为评判者的可靠性,发现其与人类判断差距大且校准失败严重。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24515 2026-06-24 cs.AI cs.HC 新提交 57%

Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

基于自主评估的计算机使用智能体强化学习

Marta Sumyk, Oleksandr Kosovan

机构 * Ukrainian Catholic University(乌克兰天主教大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出利用视觉语言模型自主评估任务完成度作为奖励信号,并引入噪声校正方法,在多个桌面环境上提升计算机使用智能体的成功率。

Comments Accepted to the 4th International Workshop on Generalizing from Limited Resources in the Open World (GLOW @ IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24115 2026-06-24 cs.CV cs.AI 新提交 57%

A Benchmark for Hallucination Detection in VLMs for Gastrointestinal Endoscopy

胃肠内窥镜中视觉语言模型幻觉检测的基准测试

Aminu Lawal, Niyoj Oli, Sachin Acharya, Prashnna Gyawali, Maria Carmen Romano, Binod Bhattarai

机构 * University of Aberdeen(阿伯丁大学) Nepal Applied Mathematics and Informatics Institute for Research(尼泊尔应用数学与信息学研究所) West Virginia University(西弗吉尼亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对胃肠内窥镜领域,在Gut-VLM数据集上基准测试九种幻觉检测方法,发现白盒方法ReXTrust在所有五个视觉语言模型上AUC最高,平均领先19.5点。

Comments Accepted at the Medical Image Understanding and Analysis (MIUA) 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19910 2026-06-24 cs.CL cs.SD eess.AS 新提交 57%

Light-weight Pronunciation Assessment via Discrete Speech Token Surprisal

轻量级发音评估:基于离散语音标记的意外度

Syeda Faiza Ahmed Sara, Shammur Absar Chowdhury

机构 * Qatar Computing Research Institute, Doha, Qatar(卡塔尔计算研究所,多哈,卡塔尔)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出仅使用母语语音资源训练的轻量级发音评估框架,通过离散化语音标记和语言模型计算意外度,结合文本引导对齐特征,在无监督或少量校准下达到接近监督方法的性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22925 2026-06-23 cs.LG cs.NE 新提交 57%

EEG Benchmarking Needs a Task Specification Layer: NeuroDoc for Rulebook-Guided, Executable Benchmark Construction

EEG基准测试需要一个任务规范层:NeuroDoc用于基于规则手册的可执行基准构建

Chengxuan Qin, Zhige Chen, Shu Peng, Rui Yang, Jiping Cui, Yikai Dong, Jun Li, Liu Peng, Zhida Shang, Mingze Tang, Kay Chen Tan, Jibin Wu

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) School of Electrical Engineering, Electronics and Computer Science, University of Liverpool(利物浦大学电气工程、电子与计算机科学学院) School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院) Department of Data Science and Artificial Intelligence, Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出NeuroDoc框架,通过结构化任务规范语言和共享规则手册,将异构EEG数据集标准化为可重用基准单元,并发布包含53个条目、245个任务定义的社区审查基准语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22864 2026-06-23 cs.LG 新提交 57%

When AUC 0.998 Is Not Enough: A Candidate Evaluation Protocol for Hidden-State Probes of Indirect Prompt Injection in Multimodal Computer-Use Agents

当AUC 0.998还不够:多模态计算机使用智能体中隐藏状态探针对间接提示注入的候选评估协议

Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文通过单骨干案例研究,论证高AUC不能直接证明恶意内容检测,提出后验诊断和候选控制集来明确探针能力的边界。

Comments 17 pages, 3 figures. Camera-ready version for EvalMG '26, The 2nd Workshop on Evaluation for Multimodal Generation, co-located with SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21954 2026-06-23 cs.CL 新提交 57%

Are Multilingual Models Actually Improving? Isolating True Cross-Lingual Transfer

多语言模型真的在改进吗?隔离真正的跨语言迁移

Prasoon Bajpai, Eleftheria Briakou, Colin Cherry, Preethi Jyothi, Vihari Piratla

机构 * Google DeepMind(谷歌DeepMind) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出硬度调整迁移(HAT)分数以准确衡量跨语言迁移强度,发现小模型迁移未失效、随模型大小迁移进步慢于预期、但随时间推移有明显进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21419 2026-06-23 cs.CV cs.AI 新提交 57%

MIRCaps: A Large-Scale Mixed-Domain Dataset with Image-Level and Region-Level Captions for Fine-Grained Vision-Language Learning

MIRCaps: 一个大规模混合域数据集,包含图像级和区域级描述,用于细粒度视觉-语言学习

Arlindo Luciano Tulumba Roberto, Hyungjoon Kim

机构 * Changwon National University(昌原国立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 为解决通用与监控视频领域的混合域图像-描述数据集匮乏问题,构建了包含14万图像、98万图像级描述、174万区域级描述和139万边界框的大规模数据集,通过互补描述类型帮助视觉语言模型学习细粒度视觉属性,并在图像描述和目标检测任务上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21315 2026-06-23 cs.AI 新提交 57%

Social World Model for Lifelong Social Intelligence

社会世界模型:面向终身社会智能

Yu Luo

机构 * Central South University(中南大学)

专题命中 评测与基准 :language agent(abstract);分类 cs.AI

AI总结 提出社会世界模型,将社交互动分解为五个维度构建闭环学习框架,并配套数据合成机制与终身学习基准,使小模型可持续获取社会协调能力。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21116 2026-06-23 cs.CV cs.AI 新提交 57%

ConnectomeBench2: A Unified Benchmark for Automated Connectomic Proofreading

ConnectomeBench2:用于自动连接组校对的标准基准

Jeff Brown, Tim Farkas, Gleb Razgar, Edward S. Boyden

机构 * MIT(麻省理工学院) The Open University(开放大学) Mindspan Institute(Mindspan研究所) Yang Tan Collective(杨谭集团) McGovern Institute(麦戈文研究所) MIT Departments of Brain and Cognitive Sciences and Biological Engineering(麻省理工学院脑与认知科学系和生物工程系)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 提出ConnectomeBench2基准,包含超过716,485个专家标注的校对决策,训练单一Vision Transformer模型,在跨物种的分割错误校正和合并错误识别上达到人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21020 2026-06-23 cs.CV cs.AI 新提交 57%

CheXpercept: A Benchmark for Evaluating Expert-Level Lesion Perception in Chest X-rays

CheXpercept: 评估胸部X光片中专家级病变感知的基准

Geon Choi, Hangyul Yoon, Nalee Kim, Jeong Yun Jang, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Edward Choi

机构 * KAIST(韩国科学技术院) Samsung Medical Center(三星医疗中心) Konkuk University Medical Center(建国大学医疗中心)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出CheXpercept基准,通过粗粒度检测、细粒度轮廓评估与修正、语义级属性提取三个层次评估视觉语言模型在胸部X光片上的专家级病变感知能力,发现当前模型仅在粗粒度任务上表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20999 2026-06-23 cs.RO cs.LG 新提交 57%

Inductive Generalization for Robotic Manipulation

机器人操作的归纳泛化

Annabella Macaluso, Haochen Zhang, Ishaan Masilamony, Yingshan Chang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 提出归纳泛化概念,通过轴基评估测试策略在分布外任务变体上的泛化能力,发现现有范式(如VLA模型)失败,揭示了与数据规模正交的学习挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20889 2026-06-23 cs.LG stat.ML 新提交 57%

Temporal Causal Prior-Data Fitted Networks for Panel Data with Learned Reliability Signals

面向面板数据的时间因果先验数据拟合网络及其学习到的可靠性信号

Shravan Talupula, Saurabh Sharma

机构 * ProfitOps Inc.(ProfitOps公司)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出TCPFN,一种零样本时间因果发现基础模型,通过因果判断头联合预测多种因果属性,结合混合训练先验和离散令牌面板数据架构,实现工业规模推理,在多个基准上达到竞争性性能。

Comments 42 pages, 6 figures, 9 tables. Code and pretrained checkpoint to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20523 2026-06-19 cs.CV cs.AI cs.DB 新提交 57%

SARLO-80: Worldwide Slant SAR Language Optic Dataset 80cm

SARLO-80:全球斜距SAR语言光学数据集80cm

Solène Debuysère, Nicolas Trouvé, Nathan Letheule, Elise Colin, Georgia Channing

机构 * DEMR-ONERA – The French Aerospace Lab, Université Paris-Saclay(法国航空航天实验室DEMR-ONERA,巴黎-萨克雷大学) DTIS-ONERA – The French Aerospace Lab, Université Paris-Saclay(法国航空航天实验室DTIS-ONERA,巴黎-萨克雷大学) Hugging Face

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 为解决高分辨率SAR与光学图像及文本对齐的数据稀缺问题,基于Umbra SLC数据构建了80cm斜距网格的SAR-光学-文本三元组数据集,支持跨模态检索与生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20108 2026-06-19 cs.CV cs.LG 新提交 57%

EFIQA: Explainable Fundus Image Quality Assessment via Anatomical Priors

EFIQA: 基于解剖先验的可解释眼底图像质量评估

Pengwei Wang, José Morano, Qian Wan, Hrvoje Bogunović

机构 * Institute of Artificial Intelligence, Center for Medical Data Science, Medical University of Vienna, Austria(维也纳医科大学医学数据科学中心人工智能研究所) Christian Doppler Lab for Artificial Intelligence in Retina, Medical University of Vienna, Austria(维也纳医科大学视网膜人工智能克里斯蒂安·多普勒实验室)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出无需质量标签的EFIQA框架,利用解剖先验通过掩膜解剖修复学习正常结构,生成空间质量图,在多个基准上超越监督方法,兼具可解释性。

Comments Accepted in MIDL 2026. Code: https://github.com/penway/EFIQA

Journal ref Proceedings of Machine Learning Research 315:2248-2264, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20034 2026-06-19 cs.LG 新提交 57%

Exploring the potential of AlphaEarth and TESSERA embeddings for Fine-scale Local Climate Zone Mapping: A case study across five cities in Switzerland

探索AlphaEarth和TESSERA嵌入在精细尺度局地气候区制图中的应用潜力:以瑞士五个城市为例

Htet Yamin Ko Ko, Clement Atzberger

机构 * International Space Science Institute(国际空间科学研究所) CYCLOPS MRV

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本研究对比TESSERA和AlphaEarth嵌入与传统Sentinel-1/2数据,使用注意力U-Net将粗分辨率LCZ图提升至10米,发现嵌入模型在跨城市迁移和精度上表现更优,但跨年迁移仍是挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19706 2026-06-19 cs.CV cs.CL 新提交 57%

NEST: Narrative Event Structures in Time for Long Video Understanding

NEST:面向长视频理解的时间叙事事件结构

Ali Asgarov, Kaushik Narasimhan, Najibul Haque Sarker, Hani Alomari, Chia-Wei Tang, Anushka Sivakumar, Zaber Ibn Abdul Hakim, Shaurya Mallampati, Chris Thomas

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出NEST数据集(1005部全长电影),通过多模态叙事事件标注和关系链接,评估模型在长视频中理解事件结构、时间顺序和长程依赖的能力,实验表明事件检测等任务极具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19552 2026-06-19 cs.CL 新提交 57%

LaViSA: A Language and Vision Structural Ambiguity Benchmark

LaViSA:语言与视觉结构歧义基准

Lee Sangmyeong, Shun Inadumi, Koichiro Yoshino

机构 * Nara Institute of Science and Technology(奈良先端科学技术大学院大学) Guardian Robot Project RIKEN(RIKEN守护机器人项目) The University of Osaka(大阪大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出LaViSA基准,通过七类歧义句及对应图像评估视觉语言模型利用视觉场景解决结构歧义的能力,实验显示现有模型虽能部分利用视觉信息,但在特定歧义类型和细微语义区分上仍有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18302 2026-06-18 q-bio.OT cs.LG 新提交 57%

Protein-Based Fish Species Identification: Dataset, Models, and Insights from Native Bangladeshi Fish

基于蛋白质的鱼类物种识别:孟加拉本土鱼类的数据集、模型与见解

Md Nasiat Hasan Fahim, Md. Abid Ullah Muhib, Mohammad Shahidur Rahman

机构 * Shahjalal University of Science

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本研究构建了首个孟加拉本土鱼类蛋白质序列数据集,并系统评估了七种架构,提出了一种轻量级混合模型MotifCNN-Transformer+TA-PE,在资源受限场景下优于大型蛋白质语言模型ProtBERT。

Comments Published in 2026 IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence & Networking (QPAIN). \c{opyright} 2026 IEEE. Personal use of this material is permitted

Journal ref 2026 IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence & Networking (QPAIN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19325 2026-06-18 cs.SD cs.AI cs.CV 新提交 57%

Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors

参考驱动的野外先验多说话人音频场景生成

Michael Finkelson, Daniel Segal, Eitan Richardson, Shahar Armon, Nani Goldring, Poriya Panet, Nir Zabari, Benjamin Brazowski, Or Patashnik, Yoav HaCohen

机构 * Lightricks Tel Aviv University(特拉维夫大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出ScenA方法,利用预训练的文本到音频流匹配基础模型,通过多参考声音和自然语言提示生成多说话人音频场景,并采用高噪声偏置时间步分布解决参考捷径问题,在CoVoMix2-Dialogue基准上优于现有系统。

Comments Project page at https://finmickey.github.io/scena/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18946 2026-06-18 cs.CL 新提交 57%

SenFlow: Inter-Sentence Flow Modeling for AI-Generated Text Detection in Hybrid Documents

SenFlow: 面向混合文档中AI生成文本检测的句间流建模

Jingkun Luo, Yifan Sun, Da-Tian Peng, Guanxiong Pei

机构 * Northwestern Polytechnical University(西北工业大学) Zhejiang Lab(浙江实验室)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 针对人机混合文档的句子级AI文本检测,提出SenFlow模型,通过图传播和CRF解码建模句间依赖,在MOSAIC基准上跨域F1提升4.15个百分点。

Comments 16 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18733 2026-06-18 cs.SE cs.AI 新提交 57%

SWE-Future: Forecast-Conditioned Data Synthesis for Future-Oriented Software Engineering Agents

SWE-Future: 面向未来软件工程智能体的预测条件数据合成

Qiao Zhao, JianYing Qu, Jun Zhang, Yehua Yang, Hanwen Du, Zhongkai Sun

机构 * Baidu Inc(百度公司)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 提出SWE-Future方法,利用仓库历史证据预测未来任务类型(如功能实现、缺陷修复),并基于预测条件合成200个编码智能体任务,减少对历史PR回放的依赖,在80个仓库中达到58.1%的未来工作相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18539 2026-06-18 cs.LG stat.ML 新提交 57%

TS-Fault: Benchmarking Time Series Forecasters Against Structural Faults

TS-Fault: 针对结构性故障的时间序列预测器基准测试

Yuyang Zhao, Lian Xu, Hao Miao, Chenxi Liu, Hao Xue

机构 * Ray-zyy

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出TS-Fault基准,通过参数化故障场景(沿观测/机制、单变量/多变量两轴)评估时间序列预测模型鲁棒性,发现干净数据准确性与鲁棒性负相关、机制级故障重排排名、基础模型最脆弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18268 2026-06-18 cs.SI cs.AI 新提交 57%

Towards Multi-Agent-Simulation-Based Community Note Evaluation

迈向基于多智能体模拟的社区笔记评估

Changxi Wen, Shuning Zhang, Bohao Chu, Yuwei Chuai, Hui Wang, Dai Shi, Xin Yi, Hewu Li

机构 * Tsinghua University, Beijing, China(清华大学,北京,中国) University of Duisburg-Essen, Duisburg, Germany(杜伊斯堡-埃森大学,杜伊斯堡,德国) University of Luxembourg, Luxembourg(卢森堡大学,卢森堡) Tongji University, Shanghai, China(同济大学,上海,中国)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 针对社区事实核查中跨共识延迟和低比例问题,提出ComRate数据集和MultiCom多智能体框架,通过矩阵分解聚类与校准聚合实现高精度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17929 2026-06-17 cs.AI 新提交 57%

PreAct: Computer-Using Agents that Get Faster on Repeated Tasks

PreAct:在重复任务上加速的计算机使用代理

Bojie Li

机构 * Pine AI

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出PreAct方法,通过将首次成功执行编译为状态机程序,在后续任务中直接重放,避免逐步骤调用语言模型,实现8.5-13倍加速,并确保重放时屏幕状态匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17727 2026-06-17 cs.AI 新提交 57%

LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings

LongWebBench: 评估长程设置下的结构和功能性网页生成

Yi Zhao, Zhen Yang, Mengpan Chen, Mingde Xu, Shanghui Gong, Xijun Liu, Jibing Gong, Jie Tang

机构 * Tsinghua University(清华大学) Yanshan University(燕山大学) University of Waterloo(滑铁卢大学) Beihang University(北京航空航天大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出LongWebBench基准,通过结构保真度和功能可执行性评估长网页生成,发现视觉相似性高但多步交互失败。

Comments 49 pages, 38 figures

详情

展开后加载摘要…

URL PDF HTML 收藏