-
阿里云的史诗级故障,缓解了程序员的精神内耗?
在大部分人的认知中,服务器宕机,产品“崩了”这种事故,往往是因为流量太大,短期内访问量达到峰值。 比如微博上明星突然官宣、双十一付尾款的关键时间点…… 双十一当晚,大家还在调侃着“今年服务器没崩溃,纯粹是因为流量比往年惨淡”的时候。没想到第二天,阿里系产品突然接连因“崩了”挂上热搜。 淘宝、闲鱼、钉钉、阿里云盘、饿了么、天猫精灵、菜鸟、夸克等多个阿里系App出现无法访问或服务异常的情况,简直让人瞠…- 5
- 0
-
有趣视频 – 怎么教育孩子?穷人与富人的人生七年
这本书可能试图揭示出社会阶层之间的巨大差距以及机会不平等的问题。它可能会通过比较穷困潦倒的人和富有的人七年来在财富、职业、教育、健康等方面的变化来实现这一目标。 书中可能会提出一些令人深思的观点,例如社会阶层之间的差距是如何形成的,机会不平等是如何导致贫富差距的加剧的,以及如何才能缩小这种差距等等。 总之,“穷人与富人的人生七年”这本书可能会引起人们对社会阶层和贫富差距的关注,并引发对这些问题的思…- 1
- 0
-
运维稳定性 – 软件测试的价值
阿里十年总结之软件测试的价值 最近拜读了很多集团测试大佬总结过往工作经验写下的文字。我想,自己从事测试工作已经十几年,绝大部分工作历程是在阿里度过的,经历了测试团队的分分合合,见过山川大海,也走过土丘洼地。借此机会,也对“软件测试的价值”做个探讨,也希望有机会跟团队一起走出当前的周期。 质量是什么? 质量是一种奢侈品 以前跟同事聊天时说,一个创业团队是不需要测试的。包括太禅老师文章中关于“来往”的…- 3
- 0
-
运维生产故障有哪些?运维常见问题最佳实践
运维生产故障是指在运维过程中出现的各种问题和故障,可能导致系统停机、服务中断或其他运维效率问题。运维生产故障可以根据不同的因素进行分类,下面是一些常见的运维生产故障分类和其常见类型: 1. 硬件故障硬件故障是指由于服务器、网络设备或其他硬件设备的故障或损坏导致的系统停机或服务中断的问题。常见的硬件故障类型包括:– 服务器故障:例如硬盘故障、内存故障等。– 网络设备故障:例如…- 16
- 0
-
运维工具 – PYTHON 日常数据分析 – 按模版输出统一清单
from openpyxl import load_workbook workbook = load_workbook('file.xlsx') worksheet = workbook['Sheet1'] data = {} for row in range(2, worksheet.max_row + 1): date = worksheet&…- 0
- 0
-
-
ITIL工具 – 中小企业最流行的 8 款轻量级在线 BUG 管理工具
文章目录 Toggle 1、Excel2、PingCode3、Worktile4、Bugzilla5、禅道6、Jira7、ClickUp8、Zoho bug Tracker 1、Excel 过去很多年,国内好一点的团队会用 excel 或者 word 文档来记录和管理缺陷问题。当然,现在依然有团队还在使用这些工具进行 bug 管理。用 excel 或者 word 文档来进行管理的优点是:上手容易,…- 4
- 0
-
故障治理 – 优酷双11猫晚技术质量保障
阿里QA导读:大家还记得天猫双11狂欢夜(猫晚)吗?小编依然还会经常听到真实力老酷guy腾格尔老师钢铁硬核版的《丑八怪》。与往年猫晚相比,今年是最“国际化”的一届,整场晚会通过优酷进行了全球直播覆盖,在这样的双11猫晚的特殊场景下,如何完成质量保障工作,让全球直播也能“如丝般顺滑”,让不同地域、不同设备的用户都能享受极致的体验? 本文为阿里文娱测试开发专家 宫浩 在【阿里文娱2019双11猫晚技术…- 11
- 0
-
【运维工具】Flink SQL 基础实践 – 深入分析 Flink SQL 工作机制
本文整理自 Flink Forward 2020 全球在线会议中文精华版,由 Apache Flink PMC 伍翀(云邪)分享,社区志愿者陈婧敏(清樾)整理。旨在帮助大家更好地理解 Flink SQL 引擎的工作原理。文章主要分为以下四部分: 1、Flink SQL Architecture 2、How Flink SQL Works? 3、Flink SQL Optimizations 4、S…- 0
- 0
-
[经验分享]远离故障的十大原则
故障是运维人员永远的痛。相信每一个运维人员的KPI中都有一项:可用性。可用性高就是不出故障,各个公司对可用性和故障评级的标准都不相同,但是避免故障的方法却是殊途同归。我们怎么避免故障,沃趣科技简单列举了以下几条,与大家共勉!1、变更要有回滚,在同样的环境测试过2、对破坏性的操作谨慎小心3、设置好命令提示4、备份并验证备份有效性5、对生产环境存有敬畏之心6、交接和休假最容易出故障,变更请谨慎7、搭建…- 5
- 0
-
CMDB是配置管理库它应该长得怎么样?数据资产体系如何建设?
一、认识数据资产 二、数据治理-方法论 三、CMDB平台建设 四、B站SRE资产平台建设之路 一、认识数据资产 1. 数据资产——企业IT价值 如图所示,未进行数据资产化建设时,数据可能呈现离散状态,数据生产和消费不统一,容易出现数据孤岛或零利益的情况。 建设数据资产化后,我们整合不同渠道数据,构造统一的数据源,或数据采集、存储、分析的流程链路,进而统一对应的数据结构、数据关系和消费出口。 运营数…- 42
- 0
-
PYTHON基础技能 – Python金融数据分析:10个金融数据挖掘的技巧
文章目录 Toggle 文章引言1. 数据清洗2. 异常值检测3. 数据标准化4. 特征选择5. 时间序列分析6. 移动平均7. 自相关和偏自相关8. ARIMA模型9. 回归分析10. 机器学习模型实战案例:股票价格预测总结 文章引言 在金融数据分析中,数据的质量直接影响到最终分析结果的准确性与可靠性。从数据清洗、异常值检测到数据标准化,再到特征选择以及各种预测模型的应用,每个步骤都是确保最终预…- 2
- 0
-
PYTHON基础技能 – Python增强办公效率的11个实用代码段
文章目录 Toggle 引言1. 快速生成批量文件夹2. 批量重命名文件3. Excel 数据处理4. PDF 文档合并5. 文本内容替换6. 发送邮件自动化7. 数据可视化8. Excel 数据批量处理9. 自动化生成报告10. 文件压缩与解压11. 实战案例:自动化数据处理与报告生成总结 引言 在日常工作中,许多任务可以通过编程自动化来提高效率。本文将介绍一些实用的 Python 脚本,用于批…- 6
- 0
-
PYTHON基础技能 – Python条件表达式优化的15个实例
文章目录 Toggle 引言1. 基础:三元运算符2. 简化比较操作3. 列表或空值处理4. 避免重复计算5. 字符串操作进阶技巧与应用6. 多条件判断7. 列表推导中的应用8. 初始化变量9. 函数返回值优化继续深入:条件表达式的高级应用与实战案例10. 错误处理简化11. 高级:嵌套条件12. 利用条件表达式进行列表过滤13. 逻辑与短路特性14. 实战案例:动态配置设置15. 最后的思考:平…- 0
- 0
-
数字化运营基础技能 – 会员数字化运营实践案例
导入库 import time # 时间库 import numpy as np # numpy库 import pandas as pd # pandas库 import pymysql # mysql连接库 from sklearn.ensemble import RandomForestClassifier # RF库 # from pyecharts import Bar3D # 老版本代…- 1
- 0
-
故障复盘 – 复盘工具 KPT法
文章目录 Toggle KPT法故障复盘案例案例1:服务器宕机事件案例2:网络通信故障案例3:软件系统bug导致用户数据异常 KPT法故障复盘案例 KPT法(Keep/Problem/Try)是一种简洁实用的复盘方法,分别对应保留(维持好的做法)、问题(识别现存问题)和尝试(提出改进措施)三个方面。下面是三个应用KPT法进行故障复盘的案例: 案例1:服务器宕机事件 Keep(保留):在此次服务器宕…- 10
- 0
-
2021.10.07 一行小错为何产生巨大破坏-Facebook史诗级故障大反思学习
Facebook大故障原因:一条写得很糟糕的命令、一款有缺陷的审核工具、一个阻碍成功恢复网络的DNS系统、以及严密的数据中心安全 Facebook故障是一系列不幸的事件酿成的! 一条写得很糟糕的命令、一款有缺陷的审核工具、一个阻碍成功恢复网络的DNS系统以及严密的数据中心安全,所有这些因素导致了Facebook长达 7 个小时的重大故障。 Facebook 表示,周一故障的根本原因是例行维护工作出…- 3
- 0
-
运维工具 – 数据构造实例
生成随机数 fruits = ['apple', 'orange', 'apple', 'apple'] * 10 print(fruits) N = len(fruits) df = pd.DataFrame({'fruit': fruits, 'basket_id'…- 1
- 0
-
IT服务治理 – AIOps 在腾讯的探索和实践
1 从一个 NLP 故事说起 首先我想从一个 NLP 小的故事来说起。 在二十世纪三四十年代,人们大量尝试用机器的方式去理解自然语言,开始是用类似于左图一样的语法树的基于规则的方式处理的,但后来逐渐地变化为以统计的方式去做。 到了二十世纪七十年代之后,基于规则的句法分析逐渐地走到了尽头。 1972年的时候,自然语言处理领域大师贾里尼克加入了IBM。1974年左右,他在 IBM 提出了基于…- 8
- 0
-
实践案例 – 故障治理 阿里智能化故障治理流程探索和实践
阿里巴巴集团拥有电商、金融、文娱、新零售、云计算等种多种业务形态,如何对这些业务形态做集团层面的统一故障治理,对产品/技术/运营都是巨大的挑战。阿里巴巴集团全球运行指挥中心(GOC)通过多年的探索,积累了大量跨 BU 故障治理经验,并在过程中使用了创新了自动化、智能化体系。 本次演讲将会对阿里巴巴集团故障治理整体流程及实战中的自动化、智能化体系做以介绍,并对未来故障治理领域智能运维工作进行展望。 …- 3
- 0
-
稳定性的灯塔:腾讯 SRE 质量运营体系建设实践
本文将从整体角度出发,探讨腾讯 SRE 质量运营体系是如何构建和实践的,以及建设过程中经验和思考,并进行总结和展望。 01 行业背景 稳定性建设是一件很让大家头疼事情,就像我刚开始入职做 SRE 时一样,面对稳定性建设总是觉得无从下手。Google 的 SRE 提供了一些指导方向,Google SRE 这本书的核心是引导大家如何科学地进行稳定性建设。在此基础上,我们决定在腾讯大规模采用基于 SLO…- 7
- 0
-
大模型,方向比速度更重要
“现代管理学之父”德鲁克先生曾说过这样一句话,被认为“商业之美”最好的形容:“世界上之所以出现鞋匠,是因为有人需要鞋,而不是因为鞋匠需要钱。” 国产大模型,再添新劲旅。9月7日,在腾讯一年一度的全球数字生态大会上,腾讯集团高级执行副总裁、云与智慧产业事业群CEO汤道生宣布,腾讯将迈入“全面拥抱大模型”时代。同时,其自主研发的通用大模型——混元也正式对外发布,揭开了外界猜测已久的腾讯大模型面纱。坦白…- 3
- 0
-
阿里大模型通义千问开源
从官网中介绍,通义千问有以下几个优点: 训练时使用了大规模的高质量数据:使用了超过2.2万亿token进行预训练 更好地支持多语言:基于更大词表的分词器在分词上更高效,同时它对其他语言表现更加友好。用户可以在Qwen-7B的基础上更方便地训练特定语言的7B语言模型。 支持8K长度上下文:允许用户输入更长的prompt。 评测能力有大幅提升:通义千问在多个评测数据集上具有显著优势,甚至超出12-13…- 4
- 0
-
运维原则 – 谷歌SRE的7条基本原则
拥抱合理的风险最大化系统的稳定性不仅毫无意义,而且会适得其反。不切实际的可靠性目标限制了新功能交付给用户的速度,而且用户通常不会注意到极端的可用性(比如99.99999%),因为他们的体验是由最不稳定的组件决定的。 拥有100%的可用性需求严重限制了团队向系统交付更新和改进的能力。想要交付许多新特性的服务所有者应该选择不那么严格的SLOs,从而让他们在出现无关紧要的bug时可以继续交付。 服务所有…- 4
- 0
幸运之星正在降临...
点击领取今天的签到奖励!
恭喜!您今天获得了{{mission.data.mission.credit}}积分
我的优惠劵
-
¥优惠劵使用时效:无法使用使用时效:
之前
使用时效:永久有效优惠劵ID:×
没有优惠劵可用!









![[经验分享]远离故障的十大原则](https://aqzt.com/wp-content/uploads/20250330060215-14.png)









