分享好友 资讯首页 频道列表

【KDD2024】大数据基础工程技术集群异常检测论文入选

2024-08-26 17:5654050
 近日,由阿里云计算平台大数据基础工程技术团队主导,与浙江大学合作的论文《Cluster-Wide Task Slowdown Detection in Cloud System》被数据挖掘领域顶会ACM SIGKDD2024接收,该论文从集群整体作业执行情况分布入手,旨在解决集群整体作业运行变慢的异常检测问题。论文创造性地提出了撇脂注意力机制和picky loss function解决集群整体作业分布复合周期性及训练集污染的问题,并使用基于神经网络最优运输模块,实现精准定向检测集群整体作业运行时间分布变慢的异常。论文从新的视角分析云计算平台集群健康状态,实现了基于神经网络的集群作业整体变慢异常定向检测,与SOTA异常检测算法相比平均提升F1 score 5.3%。

ACM SIGKDD(国际数据挖掘与知识发现大会,KDD) 会议始于 1989 年,是数据挖掘领域历史最悠久、规模最大的国际顶级学术会议,被CCF(中国计算机学会)列为A类会议,KDD也是首个引入大数据、数据科学、预测分析、众包等概念的会议。KDD2024将于8.25-8.29, 在西班牙巴塞罗那举行。此次入选意味着阿里云提出的集群级别作业变慢异常检测框架获得了国际学者的认可,也是一次产学研结合的成功实践。

针对大规模云计算平台集群作业运行变慢的异常检测问题,存在以下挑战:

(1)从个体作业入手监测集群是否存在显著变慢问题,会受到虚拟环境不确定性对个体执行速度的干扰,对个体进行检测、形成定性结论再集合到整体的方式无法准确反映整体作业执行状况。

(2)对每个作业进行监测,与对整体分布进行监测相比,需要花费更多计算存储资源。

(3)训练数据中并不能总是保证所有数据都是正常的,往往也会夹杂无标签的异常数据,这与无监督异常检测的假设相悖。

论文首次从集群整体作业执行情况分布入手,检测集群整体作业分布变慢的问题。创造性地提出了撇脂注意力机制和picky loss function解决集群整体作业分布复合周期性及训练集污染的问题。并使用基于神经网络最优运输模块,定向检测集群整体作业分布变慢的问题。论文从新的视角分析集群健康状态,实现了基于神经网络的集群作业整体变慢异常定向检测,与SOTA异常检测算法相比平均提升F1 score 5.3%。

目前对应算法已经在阿里云云原生大数据计算服务MaxCompute集群异常监控场景中进行灰度。可以有效地帮助运维人员对集群运行健康状况进行评估,提前发现可能的风险隐患。

论文信息

● 论文名字:Cluster-Wide Task Slowdown Detection in Cloud System

● 论文作者:Feiyi Chen, Yingying Zhang, Lunting Fan, Yuxuan Liang, Guansong Pang, Qingsong Wen, Shuiguang Deng

● 论文pdf链接:https://arxiv.org/abs/2408.04236

● 部分参考文献:

【1】Su Y, Zhao Y, Niu C, et al. Robust anomaly detection for multivariate time series through stochastic recurrent neural network[C]//Proceedings of the 25th ACM SIGKDD international conference on knowledge discovery & data mining. 2019: 2828-2837.

【2】Zhang C, Song D, Chen Y, et al. A deep neural network for unsupervised anomaly detection and diagnosis in multivariate time series data[C]//Proceedings of the AAAI conference on artificial intelligence. 2019, 33(01): 1409-1416.

【3】Xu J, Wu H, Wang J, et al. Anomaly transformer: Time series anomaly detection with association discrepancy[J]. arXiv preprint arXiv:2110.02642, 2021.

【4】Yang Y, Zhang C, Zhou T, et al. Dcdetector: Dual attention contrastive representation learning for time series anomaly detection[C]//Proceedings of the 29th ACM SIGKDD Conference on Knowledge Discovery and Data Mining. 2023: 3033-3045.

【5】Tuli S, Casale G, Jennings N R. Tranad: Deep transformer networks for anomaly detection in multivariate time series data[J]. arXiv preprint arXiv:2201.07284, 2022.

举报 0
收藏 0
打赏 0
阿里云受邀加入Elastic AI Ecosystem联盟,助力企业加速RAG应用开发
近日,AI搜索公司Elastic宣布推出其全新的AI Ecosystem联盟,阿里云作为中国唯一受邀加入的厂商,携手Elastic共同为全球用户提供强大的AI搜索开发平台,推动AI搜索技术的广泛应用。

0评论2024-11-225528

智能建造领军企业获国际智能建造可持续发展合作伙伴荣誉
2024年11月18日,一场聚焦智能建造未来发展的高端论坛国际智能建造高端论坛在北京成功召开。此次论坛汇聚了众多国内外智能建造领

0评论2024-11-225552

高校AI通识课全面铺开,老师率先“升级”迎接挑战”
11月16-17日,西安交通大学和百度共同举办了AI通识教育主题高级研修班。60多名来自全国各地的老师花了一个周末,和百度的工程师一起探讨AI通识课“教什么”“怎么教”。

0评论2024-11-215913

第十九届中博会圆满落幕!五大关键词解读盛会成果
11月18日,为世界中小企业搭建“展示、交易、交流、合作”平台的第十九届中国国际中小企业博览会落下帷幕,五大关键词解读盛会成果。

0评论2024-11-215710

未来之“光”:艾迈斯欧司朗引领汽车照明革新
作为光源领域的领导者,艾迈斯欧司朗以光子为媒介,架起智能化汽车与终端用户(包括驾驶员、乘客及道路使用者)之间的交互桥梁。

0评论2024-11-185969

发展新质生产力,龙华区亮相第26届高交会展示硬核科技
2024年11月14日至16日,第二十六届中国国际高新技术成果交易会(以下简称“高交会”)在深圳国际会展中心举行,龙华区共28家创新型企业组团亮相。

0评论2024-11-156193

深圳NEPCON电子展圆满落幕,镭晨科技新品备受瞩目
2024年 11 月 6 日- 8 日,2024 NEPCON ASIA亚洲电子展在深圳国际会展中心如期举行,镭晨科技携多款新品及最新技术隆重亮相。

0评论2024-11-126098

Apache Spark & Paimon Meetup · 北京站,助力 LakeHouse 架构生产落地
2024年11月15日 13:30-17:30(周五),北京市朝阳区阿里中心-望京A座-05F,阿里云 EMR 技术团队联合 Apache Paimon 社区,联合举办“ Apache Spark & Paimon, 助力 LakeHouse 架构生产落地”线下 meetup。

0评论2024-11-126204

电装:推进碳中和,人才培养不计成本
10月21日,电装在电装(广州南沙)有限公司举办碳中和节能体感教育培训活动。

0评论2024-11-126251

从富士通到RAMXEED,以全新一代FeRAM迎接边缘智能高可靠性无延迟数据存储需求
近日,富士通半导体科技(上海)有限责任公司总经理冯逸新在由E维智库举办的第12届中国硬科技产业链创新趋势峰会暨百家媒体论坛上分享公司开展FeRAM的业务。

0评论2024-11-126193