arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2608.02639 2026-08-05 cs.SE cs.AI 新提交 77%

Instruction Stacking Collapse: A Benchmark and the Capability-Dependent Value of Prompt Compilation

指令堆叠崩溃:基准测试集与提示词编译的能力依赖价值

Atul Anand, Sourav Chattaraj

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究构建了含24个指令的基准测试集,发现指令遵循率随堆叠指令数增加非线性下降,提出无需训练的指令编译器可提升较弱生产级LLM的指令遵循率,且该收益与模型能力相关。

Comments 13 pages, 11 figures. Benchmark, deterministic verifiers, and cached model responses released for full reproduction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00640 2026-08-04 cs.CL 新提交 77%

TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs

TreeProbe:面向大型语言模型文化偏见的藏医药基准测试集

Jin Zhang, Linyu Li, Weili Jiang, Yuqing Cai, Yutong Liu, Guanquecairang, Yongbin Yu, Jingye Cai, Nyima Tashi, Gadeng Luosang

机构 * University of Electronic Science and Technology of China(电子科技大学) Tibet University(西藏大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究针对大型语言模型的藏医药文化偏见问题,构建了首个基于藏医药“医学之树”框架的基准测试集TreeProbe,发现现有模型存在系统性本体漂移,为公平医疗AI开发提供了诊断基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28269 2026-07-31 cs.CV cs.AI cs.MM 新提交 77%

Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation

Theia:用于无数据蒸馏的Incidents1M数据集的大规模多模态字幕生成与自动验证

Simone Giano, Lorenzo Severini, Alessandro Galdelli, Adriano Mancini

机构 * Università Politecnica delle Marche(马尔凯理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本研究针对灾害领域多模态数据集的缺陷,提出方法构建并自动验证Incidents1M数据集,生成高保真字幕,其语义一致性达78.65/100,为跨模态知识蒸馏提供了可扩展框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28037 2026-07-31 cs.LG 新提交 77%

ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents

ClawTrack:面向真实世界智能体的追踪级评估与改进

Xingjian Wu, Xuhang Zhu, Xingchen Liu, Junlin Liu, Jianing Wang, Linsen Guo, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 评测与基准 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 本研究针对现有智能体评估仅看结果的缺口,提出双评估基准ClawTrack,含320个任务及过程评分器,评估21个模型后发现其可归因推理、验证结果验证瓶颈等,助力智能体改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26611 2026-07-30 cs.AI cs.HC 新提交 77%

Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants

更少澄清,更优代码:评测编码助手的跨会话个性化歧义适应能力

Zijian Xu, Wenshuo Zhang, Zisen Qin, Rui Sheng, Yushi Sun, Huamin Qu, Chuhan Shi

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 该研究提出个性化歧义适应新任务,构建CAPA评测基准,评估12个LLM在有无用户历史下的表现,提出同用户历史门控方法,助力开发减少重复澄清的长期编码助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25675 2026-07-29 cs.AI 新提交 77%

DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

DecoEvo:文本空间中求解器与评分标准生成器技能的分数解耦协同进化

Jiangwang Chen, Zixin Song, Junlin Liu, Shuaiyu Zhou, Haiyan Wu, Haihan Shi, Chenxi Zhou, Hanqing Li, Xiao Yang, Da Zhu, Guanjun Jiang, Hai Wan, Xibin Zhao

机构 * Tsinghua University(清华大学) Qwen Business Unit of Alibaba(阿里巴巴的通义业务部) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究文本空间优化中现有方法瓶颈,提出DecoEvo方法,通过解耦目标协同进化求解器与评分标准生成器技能,不依赖黄金评分标准,在多基准和大语言模型主干上表现优异,有显著相对增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24766 2026-07-29 cs.AI 新提交 77%

Crystalis: Progressive Nucleation and Semantic Annealing for Coordinated Multi-View Visualization Generation

Crystalis:用于协同多视图可视化生成的渐进式成核与语义退火

Dazhen Deng, Zhaoping He, Xin Qian, Xiaotong Wang, Zi Ying, Yingcai Wu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 研究针对大语言模型难以生成协同多视图可视化的问题,提出Crystalis框架,基于以查询为中心的CMV建模,通过渐进式成核和语义退火机制,在多任务基准测试中取得高成功率,且经用户研究验证了工作流程可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24190 2026-07-28 cs.RO cs.AI cs.HC 新提交 77%

Not Forgotten: Implementation and Evaluation of a Personalized Episodic Memory for the Humanoid Robot Head Kim

未被遗忘:人形机器人头部Kim的个性化情景记忆的实现与评估

Steve Aschenbrenner, Marcel Heisler, Thomas Sievers, Christian Becker-Asano

机构 * Stuttgart Media University(斯图加特媒体大学) University of Lübeck(吕贝克大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对社交机器人跨会话无记忆问题,提出在人形机器人头部Kim上集成轻量级情景记忆模块,结合语义检索与对话系统,用混合评分函数检索交互并注入提示,实验表明该模块提升社交性且未引发负面反应。

Comments Acceoted at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026) Kitakyushu, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22759 2026-07-28 cs.AR cs.LG 新提交 77%

Benchmarking LLMs for Verilog Design Flows

对用于Verilog设计流程的大语言模型进行基准测试

Angshuman Chakravertty, Rahul Koshti, Buddhi Prakash Sharma, Vinay Chamola

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.LG

AI总结 研究针对大语言模型生成Verilog RTL代码能力的基准测试问题,提出含特定流程的可重复平台,经测试提升了开源模型的语法有效性和模拟通过率,且平台与数据集开源,利于生成式人工智能在硬件设计工作流的评估。

Comments 7 pages, 3 figures, 3 tables. Manuscript prepared for submission to IEEE Design & Test

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22345 2026-07-27 cs.RO cs.AI 新提交 77%

Teachy Mini: Development and Preliminary Evaluation of a Knowledge-Based Generative Social Robot for Higher Education

Teachy Mini:用于高等教育的基于知识的生成式社交机器人的开发与初步评估

Stephan Vonschallen, Karim Kaufmann, Dominique Oberle, Friederike Eyssel, Theresa Schmiedel

机构 * Institute of Information Systems, Zurich University of Applied Sciences(苏黎世应用科学大学信息系统研究所) Center for Cognitive Interaction Technology, Bielefeld University(比勒费尔德大学认知交互技术中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究针对生成式社交机器人在高等教育辅导中的风险,基于知识的设计要求开发Teachy Mini系统,经初步评估,该系统在负责任辅导行为及个性化等方面表现更佳,虽在部分方面与对照无显著差异,但显示出基于知识的设计对学习效果有积极作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21961 2026-07-27 cs.CL 新提交 77%

On Improving Faithfulness of Podcasts from Documents

论提高基于文档的播客忠实度

Soumya Dutta, Tejas Indulal Dhamecha, Pannaga Shivaswamy

机构 * Indian Institute of Science(印度科学研究所) Adobe Research(Adobe研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究基于文档的播客生成中的忠实度问题,构建数据集并用多个大语言模型生成记录,引入轮次级评判框架。发现先进模型也常生成无根据内容,提出catch - n - repair框架,实验证明该框架能提升播客生成的忠实度。

Comments Under Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20498 2026-07-24 cs.AI 新提交 77%

AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs

AISE-Bench:用于学术知识图谱信息检索的全周期精选基准测试

Fanjin Zhang, Zhengyang Wang, Ruixuan Huang, Kefan Zhang, Amy Xin, Yuanchun Wang, Shu Zhao, Evgeny Kharlamov, Jie Tang, Juanzi Li

机构 * Renmin University of China(中国人民大学) Anhui University(安徽大学) Z-Lab Z.ai Tsinghua University(清华大学) Bosch Center for AI(博世人工智能中心) University of Oslo(奥斯陆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对学术知识图谱信息检索基准测试不足的问题,引入AISE-Bench,通过定制工作流程和综合评估协议构建基准测试,为多步API使用的大语言模型智能体提供新测试平台,助力评估与改进。

Comments 9 pages, accepted by KDD 2026

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '26), August 09-13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20474 2026-07-24 cs.AI 新提交 77%

VeriSimpl: Robust Optimization Modeling from Natural Language using Simplification-based Verification

VeriSimpl:基于简化验证的自然语言鲁棒优化建模

Sumaya Abdul Rahman, Seckhen Ariel Andrade Cuellar, Ghani Raissov, Mohammad Raza

机构 * Gurobi(古罗比) IBM(国际商业机器公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究自然语言到优化建模问题,核心方法是基于简化验证理念,利用优化求解器生成诊断查询让大语言模型推理公式正确性,主要贡献是在优化基准测试中提升准确性并提供高精度自验证信号。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17963 2026-07-21 cs.AI 新提交 77%

OntoExtend: A Framework for Requirement-driven and Scalable Ontology Extension with LLMs

OntoExtend:一个用于基于需求驱动和可扩展的大语言模型本体扩展框架

Anna Sofia Lippolis, Mohammad Javad Saeedizade, Stefan Schmid, Simon Blattner, Robin Keskisärkkä, Aldo Gangemi, Eva Blomqvist, Andrea Giovanni Nuzzolese

机构 * Linköping University(林雪平大学) University of Bologna(博洛尼亚大学) Bosch(博世公司) ISTC-CNR(意大利国家研究委员会信息科学与技术研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于需求驱动的本体扩展问题,提出用检索增强生成的OntoExtend框架,通过在相关输入本体和需求上应用该框架,在两个用例的能力问题上评估,结果显示其可作为现实场景中本体扩展起草助手,对问题特异性和建模概要敏感。

Comments Accepted in research track of Semantics 2026: https://2026-eu.semantics.cc/page/accepted_research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17828 2026-07-21 cs.CL 新提交 77%

When a Name Is Not a Name: A Benchmark Dataset and Distilled Reasoning for Culturally Entangled Bangla Homographs in Low-Resource LLMs

当一个名字并非名字时:低资源语言模型中文化纠缠的孟加拉语同形异义词的基准数据集和提炼推理

Md. Asaduzzaman Shuvo

机构 * United International University(联合国际大学)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);prompting(abstract);分类 cs.CL

AI总结 研究针对低资源语言模型中孟加拉语同形异义词文化纠缠问题,构建基准数据集。发现模型有主导意义偏差,特定模型失败。提出对比性思维链提示及提炼文化解释,能减少偏差,让小模型正确推理,提升系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17173 2026-07-21 cs.CL 新提交 77%

KyrgyzLLM-Bench: Benchmarking Kyrgyz Language Understanding

吉尔吉斯语大语言模型基准测试:吉尔吉斯语理解的基准测试

Timur Turatali, Aida Turdubaeva, Rustem Izmailov, Anton M. Alekseev, Sergey I. Nikolenko

机构 * Institute of IT, Kyrgyz State Technical University named after I. Razzakov(以I. 拉扎科夫命名的吉尔吉斯国立技术大学信息技术学院) School of Computer Science, University of Windsor(温莎大学计算机科学学院) St. Petersburg Department of the Steklov Math. Institute, RAS St. Petersburg State University(俄罗斯科学院斯捷克洛夫数学研究所圣彼得堡分部,圣彼得堡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 针对吉尔吉斯语大语言模型评估难的问题,利用KyrgyzLLM - Bench基准套件,包含两个本地数据集及多个翻译编辑后的数据集,在零样本和少样本设置下评估26个模型,分析性能等,发布相关资源以支持吉尔吉斯语NLP研究。

Comments Preprint; manuscript currently under consideration at a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17152 2026-07-21 cs.CR cs.CL 新提交 77%

How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions

越狱攻击如何为安全对齐提供信息:以防御者为中心、基于Shapley值的越狱贡献评估

Yukai Zhou, Feiyang Lu, Xiaokai Mao, Jinfei Liu, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究以防御者为中心评估越狱攻击,提出A - MESS框架,通过AttackSHAP估计攻击效用,在不同场景下实验发现攻击成功率排名与防御者效用弱对齐,有限查询能准确估计,直接优化子集安全效用更强,建议将越狱攻击视为安全改进资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17122 2026-07-21 cs.CL 新提交 77%

Scope3Trace: Evidence-Based Identification and Extraction of Scope 3 GHG Emissions from Sustainability Reports

Scope3Trace:基于证据的可持续发展报告中范围三温室气体排放识别与提取

Siyuan Zheng, Yifan Duan, Chao Xue, Flora D. Salim

机构 * UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对范围三温室气体排放分析难题,提出Scope3Trace框架,集成多种技术从ESG和可持续发展报告中提取相关信息,并构建多模态数据集,实现了异构可持续发展披露信息可靠提取与透明整合,且提取精度高。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16175 2026-07-20 cs.CR cs.AI 新提交 77%

Evaluating Open-Weight LLMs for Generating Structured Threat Information for Autonomous Vehicle Vulnerabilities

评估开放权重语言模型用于生成自动驾驶车辆漏洞的结构化威胁信息

Md Erfan, Ahmed Ryan, Md Kamal Hossain Chowdhury, Md Rayhanur Rahman

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究自动驾驶车辆漏洞相关结构化威胁信息生成问题,利用开放权重语言模型,通过构建CAV-STIXGen数据集评估11个模型,分析CWE和MITRE ATT&CK共现,展示AI辅助转换可自动化威胁情报并优先防御运输安全。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16001 2026-07-20 cs.CL 新提交 77%

BayesPO: Bayesian Prompt Optimization via Parallel-Tempered Gradient-Guided Discrete MCMC

BayesPO:通过并行回火梯度引导离散MCMC进行贝叶斯提示优化

Junjie Zhou, Zhijian Ou

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究将提示优化作为离散提示令牌上的贝叶斯后验采样问题,提出BayesPO框架,结合任务似然项与语言模型先验定义后验分布,用马尔可夫链蒙特卡罗实例化,实验表明其能发现有意义提示、逃离局部最优并提高准确率,同时揭示了两个主要局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15560 2026-07-20 cs.NE cs.AI 新提交 77%

Evolutionary Algorithm-Guided LLMs for Physics-Informed Neural Network Design

用于物理信息神经网络设计的进化算法引导的大语言模型

Xu Yang, Mingyang Yu, Jing Xu, Keqian Li

机构 * Shanghai Institute of Intelligent Education, East China Normal University, Shanghai(上海智能教育研究所,华东师范大学,上海) College of Artificial Intelligence, Nankai University(人工智能学院,南开大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对物理信息神经网络(PINNs)设计敏感的问题,提出用进化算法引导大语言模型跨代生成可执行配置,经一维波动方程实验验证可行性,能降低均方误差,还揭示了低解误差与高PDE残差可共存等情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15216 2026-07-17 cs.CV cs.AI 新提交 77%

Symbal: Detecting Systematic Misalignments in Model-Generated Captions

Symbal:检测模型生成字幕中的系统性对齐错误

Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型生成图像字幕时的系统性对齐错误检测问题,提出利用现成基础模型的结构化双阶段设置的Symbal方法,引入SymbalBench基准,Symbal在基准上表现出色,可辅助审核MLLM生成的字幕。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15205 2026-07-17 cs.SE cs.AI 新提交 77%

MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization

MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的可控基准

Shaoxiong Zhan, Shi Hu, Boyu Feng, Hai Lin, Andrew Gong, Zhengda Zhou, Jiaying Zhou, Yunyun Hou, Hao Su, Hai-Tao Zheng

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究针对仓库级问题定位多为文本任务,视觉证据作用不明的情况,引入MM-IssueLoc基准和评估协议,含多语言实例与标注等。评估LLM和检索系统,发现现有系统距可靠多模态定位有差距,该基准让视觉证据成评估变量,助于后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14818 2026-07-17 cs.LO cs.AI 新提交 77%

Can LLMs Build a MaxSAT Solver from Papers? The CoreForge Experience

大语言模型能否根据论文构建最大可满足性求解器?CoreForge 经验

Ruben Martins

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究利用大语言模型从论文构建无权重 MaxSAT 求解器,采用结合论文讨论、代码实现及审核修订的迭代流程,评估特定配置,发现虽未现错误答案,但性能低于手工设计求解器,总结了相关经验教训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14309 2026-07-17 cs.AI cs.CY 新提交 77%

Traccia: An OpenTelemetry-Based Governance Platform for AI Systems

Traccia:一个基于OpenTelemetry的人工智能系统治理平台

Nutan Kumar Naik, Aditya Kumar Saroj, Vijay Prasad Poudel, Saurav Samantray, Abhishek Patel

机构 * National Institute of Technology Rourkela(鲁尔基国立技术学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型和人工智能驱动智能体发展带来的软件治理问题,提出基于OpenTelemetry构建多层次人工智能治理堆栈Traccia,通过添加遥测数据等解决对齐问题,自动创建合规证据包,为企业管理自主人工智能系统创建机器可读基础。

Comments 26 pages, 2 figures, 3 tables, Declaration of generative AI and AI-assisted technologies in the writing process, Declaration of competing interest

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12619 2026-07-15 cs.AI cs.ET 新提交 77%

Agentic Service-Oriented Computing: A Manifesto for the Next Frontier of Service-Oriented Computing

面向智能体的面向服务计算:面向服务计算新前沿宣言

Amin Beheshti, Rong N. Chang, Boualem Benatallah, Fabio Casati, Schahram Dustdar, Geoffrey Fox, Quan Z. Sheng, Yan Wang, Jian Yang, Albert Zomaya

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究LLM驱动的智能体融入复杂工作流面临的挑战,提出面向智能体的面向服务计算(ASOC)。阐述其六个基本原则,组织五维研究议程,旨在将智能体AI从零散演示转变为可靠的基于服务的系统,为新兴领域提供支撑。

Comments Accepted at the 2026 IEEE International Conference on Web Services (ICWS); Corresponding author: Prof. Amin Beheshti; DOI 10.1109/ICWS72778.2026.00163

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11437 2026-07-14 cs.CL 新提交 77%

Relational Positioning as a Measurable Risk Object: History-Carried Lock-in and Self-Confabulation in Multi-Turn Human-AI Dialogue

作为可测量风险对象的关系定位:多轮人机对话中的历史锁定和自我虚构

Jihong Chen

机构 * Beijing Etown Academy(北京亦庄实验中学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多轮人机对话中大语言模型的关系定位,定义并验证关系定位度量D1,刻画其立场,揭示历史携带锁定和自我虚构两种关系失败模式,通过控制门控和标尺证实,为相关研究提供新认知。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11042 2026-07-14 cs.SE cs.AI 新提交 77%

BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services

BackendForge:使用后端服务对智能端到端代码生成进行基准测试

Yuzhe Guo, Mengzhou Wu, Yuan Cao, Jialei Wei, Dezhi Ran, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(北京大学计算机科学与技术国家重点实验室;软件学院,北京大学) SCS, Peking University(北京通明湖信息技术应用创新中心) Beijing Tongming Lake Information Technology Application Innovation Center (TLAIC)(复旦大学高级计算系统研究所) Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) Shanghai Institute of Systems for Open Computing

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究智能端到端代码生成评估问题,引入BackendForge基准,给定规范和契约让大语言模型生成容器化服务,用测试和代码代理共同进化测试预言机和参考服务,发现当前大语言模型虽能实现部分API行为,但生成完整后端服务仍有困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11026 2026-07-14 cs.CL 新提交 77%

Dimensionality in Satisfaction Ratings

满意度评级中的维度

Andrew Hong, Jason Potteiger

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究用大语言模型注释消费品公司对话文本,分解客户服务满意度为多轴,验证注释与客户自评的关系,发现轴间相关性及共线性,指出分解价值在于归因和覆盖,能识别对话数据中细微的客户体验驱动因素。

Comments 25 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10768 2026-07-14 cs.AI 新提交 77%

Opti-Agent-Bench: Benchmarking End-to-End Optimization R&D Agents on Real-World Business Problems

Opti-Agent-Bench:在实际业务问题上对端到端优化研发智能体进行基准测试

Yongchang Fu, Xinjie Huang, Chengjun Dai, Chengzhe Feng, Junshao Zhang, Hong Zhu

机构 * Ding Talk, Alibaba Group(钉钉,阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型解决优化问题的现有不足,引入Opti-Agent-Bench基准测试,通过业务语义真实性、模块化评估、ORAC双层有效性框架,在多工业规模任务中揭示当前模型关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏