-
IT服务治理 – 唯品会大数据建设思路与实践
诸超 | 唯品会云计算总监 文章目录 Toggle 唯品会大数据整体规划数据平台的建设大数据对于技术运营大数据在唯品会特卖模式的业务价值 唯品会大数据整体规划 大数据无非是数据的收集、计算和存储。整个数据的实时接入,包括各种各样的log,我们的系统把这些东西离线、实时地收集进来。 如何规划系统的资源,才能做到高效的调度和利用?这是一大改变期,有了这样一个平台以后,如何做各个数据的分析和计算?不能只…- 4
- 0
-
故障治理 – 运行无间:阿里巴巴运维保障体系的一种最佳实践
阿里巴巴全球运行指挥中心,GOC (Global Operations Center)保障阿里经济体的业务稳定运行的核心团队。我们负责了整个阿里巴巴全局生产系统的稳定性。就像业界经常提到谷歌的SRE,我们相当于阿里巴巴的SRE。 今天我的分享分为四个部分: 1、稳定性现状及挑战 2、运维…- 69
- 0
-
监控工具 – zabbix ha 官方推荐高可用集群
#CentOS 安装#安装 epel-release 依赖:yum install epel-release #安装 DNF 包:yum install dnf —————-#Fedora 安装:dnf install dnf 2,初始化yum update -ysed -i ‘s/SELINUX=enforcing/SELINUX=di…- 1
- 0
-
SRE实战手册 – 技能宝典
先聊一聊SRE的工作职责,聊一下我所理解的SRE的核心目标;初步看一下稳定性建设的工作范畴,看一看从宏观上如何划分我们的工作内容;然后我们由此进入今天的主题:故障管理,我将按照我的理解对故障管理进行拆解和分析;再后面,围绕故障管理,我们深入聊一下SRE的体系建设,如何通过体系建设来更好地做故障管理;最后我们再简单做下对未来的展望,共同畅想一下SRE工作的未来。 文章目录 Toggle 一、SRE的…- 15
- 0
-
故障处理最佳实践 – 滴滴是如何高效处理线上故障的?
故障处理是每个系统都要面对的现实问题,但随着系统越来越复杂,故障的发现、定位、处理难度也将随之增大。滴滴现在服务近 4 亿乘客、1700 多万司机、覆盖 400 多个城市,超过 10 个业务线提供服务,业务的高速增长对稳定性工作来说是个极大的挑战。为了了解滴滴在故障处理以及稳定性建设方面的工作,InfoQ 记者采访了滴滴资深运维工程师张云柳。另外,张云柳也将会在 9 月 10 日举行的 CNUTC…- 7
- 0
-
Hive Sql:工作中常用HSQL语句大全 一
文章目录 Toggle Hive Sql 大全hive的DDL语法对数据库的操作对数据表的操作对管理表(内部表)的操作对外部表操作对分区表的操作对分桶表操作修改表和删除表向hive表中加载数据hive表中数据导出hive的DQL查询语法单表查询Hive函数聚合函数关系运算数学运算逻辑运算数值运算条件函数日期函数字符串函数复合类型构建操作复杂类型访问操作复杂类型长度统计函数hive当中的latera…- 4
- 0
-
故障复盘 – 故障复盘哪三大关键问题?
这是很多企业/团队都要面对的问题,有着超10年系统稳定性保障经验的李道兵老师给我们分享了他的观点: 故障复盘的三大关键问题: 怎么有效降低故障的影响? 事故处理的流程和原则有哪些? 相关管理制度怎么设置比较合理? 故障复盘的四大注意项: 1.事故复盘不是给人定责的,要有系统思维将优化项实际落地才能推动系统优化; 2.事故报告的重点应该是事故提升项,监控、定位、根因、架构四个部分都必须涉及; 3.事…- 3
- 0
-
FLINK SQL 实践 – (十五):flink sql 开发企业级利器之 Dlink
发现有两款非常优秀的利器: Apache Zeppelin Dlink 为啥先介绍 Dlink 呢? 因为博主和其开发人员混的很熟了,所以就先拿 Dlink 来尝试尝试。 废话不多说,大家都想先看效果再看怎么部署。先看看最终效果。 文章目录 Toggle 2.Dlink 平台效果2.1.登录2.2.flink sql 开发界面3.安装部署篇3.1.Dlink 的 github3.2.部署环境准备3…- 1
- 0
-
AIGC到底是什么?利用人工智能来生成你所需要的内容,一起动手玩转AI
文章目录 Toggle AIGC( AI Generated Content)是利用人工智能来生成你所需要的内容,GC的意思是创作内容。与之相对应的概念中,比较熟知的还有PGC,是专业人员用来创作内容;UGC是用户自己创造内容,顾名思义AIGC是利用人工智能来创造内容。例如现在比较爆火的ChatGPT就是AIGC这个大赛道里下面的一个相对于很成功的产品,一经上线席卷全球,短短一个月突破1亿月活跃用…- 3
- 0
-
经验教训 – 网络安全十四条经验教训
2022年,是网络安全市场高速发展的一年,同时也是企业评估安全项目投资有效性,校准和优化安全防御战略和预算的关键时间节点。面对快速迭代的网络威胁,每位CISO都有自己的方法和视角来总结和反思即将过去的2022年,此类经验总结可为未来的战略规划提供宝贵的知识,正如Veracode首席信息安全官Sohail Iqbal所言:“如果企业不打算吸取这些教训并完善其安全实践,那么将面对更加严格的安全审计和第…- 2
- 0
-
经验教训 – 故障处理,教你30秒把问题说清楚
故障处理可参考麦肯锡30秒电梯法则思路,快速把问题陈述。 文章目录 Toggle 一 了解30秒电梯法则目标对象方法 一 了解30秒电梯法则 谈到“30秒电梯法则”不得不谈到麦肯锡:麦肯锡作为世界上最著名,最成功的战略咨询公司,已有近百年的历史,他在全球40多个国家设有80多家分公司,被称为世界第一战略、组织机构和业绩改善方面的咨询公司以及真正的全球性公司。 “…- 6
- 0
-
【运维工具】Flink SQL 天级别窗口中存在的时区问题
本文主要分为两部分: 第一部分(第 1 – 3 节)的分析主要针对 flink,分析了 flink 天级别窗口的中存在的时区问题以及解决方案。 第二部分(第 4 节)的分析可以作为所有时区问题的分析思路,主要以解决方案中的时区偏移量为什么是加 8 小时为案例做了通用的深度解析。 为了让读者能对本文探讨的问题有一个大致了解,本文先给出问题 sql,以及解决方案。后文给出详细的分析~ 文章…- 1
- 0
-
IT运维最佳实践 – 一线游戏运维心得(同行经验)
自2015年开始从事游戏行业一线运维工作,至今(2022)已经近7年。 网易游戏:2015.04 ~ 2021.04灵犀互娱:2021.04 至今 文章目录 Toggle 背景1、运维人员的定位运维叫什么?PE?SRE?什么是SRE?什么是可用率?可用率到底要达到几个9?不同人眼中的运维项目组对运维的核心诉求技术要专,还是广?运维SRE的段位2、做事方法新手常犯的错误或误区怎么推进事情落地?忙不过…- 13
- 0
-
PYTHON基础技能 – Python字典与集合的15个高级操作与优化建议
今天我们将一起探索Python中最强大且高效的两个数据结构——字典和集合,它们在数据处理中扮演着至关重要的角色。通过这15个高级操作和优化技巧,你们将学会如何像专家一样驾驭它们,让代码更加简洁高效。 文章目录 Toggle 1. 字典推导式(Dictionary Comprehensions)2. 合并字典(Using update())3. 集合的基本运算4. 字典的get()方法5. 集合推导…- 1
- 0
-
PYTHON基础技能 – Python条件控制技巧
文章目录 Toggle 一、引言二、基本的条件控制语句1. if 语句2. if-else 语句3. if-elif-else 语句三、进阶的条件控制技术1. 嵌套 if 语句2. 使用逻辑运算符3. 使用条件表达式4. 使用列表推导式和条件表达式五、实战案例:成绩管理系统 一、引言 在编程中,条件控制是实现逻辑判断的基础。Python 提供了多种方式来实现条件控制,包括 if 语句、elif 语…- 0
- 0
-
稳定性保障 – 故障应急体系构建及应用实践(2)
本文主要介绍了蚂蚁集团大规模互联网系统中业务SRE的稳定性实践,包括业务SRE的定义、应急管理、大促稳定性保障等方面,具体内容如下: 1. 业务SRE定义 – SRE概念:SRE是结合软件工程和IT运维原则,通过编程和自动化提高系统稳定性、可扩展性和效率的实践和角色,业务SRE则专注于特定业务系统的可靠性和效率。 – 工作内容:确保业务系统稳定可用,优化性能提升用户体验,定…- 8
- 0
-
PYTHON基础技能 – 用一行代码完成的26个日常任务
Python以其简洁优雅著称,能够用最少的代码行数实现强大的功能。本文特别为Python初学者设计,旨在展示Python如何以一行代码解决常见的编程任务,让你体验Python的极简美学。通过这些实例,你不仅能够学习到Python的基础知识,还能掌握一些高效编码的小技巧。 文章目录 Toggle 1. 计算列表平均值2. 列表转字符串3. 查找最大值4. 检查是否全是数字5. 反转字符串6. 平方一…- 0
- 0
-
PYTHON基础技能 – 使用 Pandas 进行时间序列分析的 11 个关键点
Pandas 是 Python 中最强大的数据处理库之一,非常适合处理时间序列数据。这篇文章将带你逐步了解时间序列分析的基础知识,以及如何用 Pandas 实现。 文章目录 Toggle 1. 时间序列数据简介2. 设置日期为索引3. 数据重采样4. 插值方法5. 移动平均6. 季节性分解7. 时间序列滞后8. 自相关和偏自相关函数9. 差分操作10. 平稳性检验11. ARIMA 模型实战案例:…- 0
- 0
-
可观测性(Observability)- 聚合度量
度量(Metrics)的目的是揭示系统的总体运行状态。相信大家应该见过这样的场景:舰船的驾驶舱或者卫星发射中心的控制室,在整个房间最显眼的位置,布满整面墙壁的巨型屏幕里显示着一个个指示器、仪表板与统计图表,沉稳端坐中央的指挥官看着屏幕上闪烁变化的指标,果断决策,下达命令……如果以上场景被改成指挥官双手在键盘上飞舞,双眼紧盯着日志或者追踪系统,试图判断出系统工作是否正常。这光想像一下,都能感觉到一股…- 6
- 0
-
故障复盘 – 为什么要复盘
复盘可以帮助我们避免犯同样的错误,固化流程、校验方向,认清问题背后的问题,发现和产生新的想法与知识。除了提升能力之外,它还对提升个人品性和组织性格有巨大作用。三思而后行,一个习惯复盘的个人和企业,品性会更加低调和踏实,避免浮躁和冒进带来的危害。为什么要复盘?这个问题更应该这么问:为什么不复盘?在某种程度上说,复盘是我们能够提高能力的唯一手段。它可以帮助我们避免犯同样的错误,固化流程、校验方向,认清…- 1
- 0
-
【经典手册】常用SQL查询
sql是所有数据库查询的语言,sql由于本身结构化的特点,非常容易入手。针对不同的数据库,如hivesql、mysql、sqlserver、oracle等,sql语法会有所不同,但是总体上大同小异,只是细微处的差别。 SQL的学习方式非常多,在这里分享最捷径的一种:用7张图片搞定数据分析相关的SQL语句问题。 具体分了七类讲解: 基础查询 字符串\数字\日期时间 聚合数据查询 子查询 联接\组合查…- 2
- 0
-
经验教训 – 软件工程没有银子弹,凡是可能出错的地方就一定会出错“24年了,终于有人发现curl的这个Bug了”
雷军每天都把卓越网的链接全部点击一遍,检查错误。作为软件工程师,雷军深知:软件工程没有银子弹,凡是可能出错的地方就一定会出错。 “24年了,终于有人发现curl的这个Bug了” 本文最初发布于 Daniel Stenberg 的个人博客。 curl 作者 Daniel Stenberg 近日在个人博客分享了一个存在 23.9 年的 curl 漏洞。curl 是常用的命令行工具,用来请求 Web 服…- 3
- 0
-
-
实践案例 – 百分点大数据技术团队:万亿级大数据监控平台建设实践 
随着互联网业务的迅速发展,用户对系统的要求也越来越高,而做好监控为系统保驾护航,能有效提高系统的可靠性、可用性及用户体验。监控系统是整个运维环节乃至整个项目及产品生命周期中最重要的一环。百分点大数据技术团队基于大数据平台项目,完成了百亿流量、约3000+台服务器集群规模的大数据平台服务的监控,沉淀了一套适合自身业务和技术特点的监控架构设计思路、设计方法和落地方案。 本文主要从监控系统整体设计和技术…- 2
- 0
幸运之星正在降临...
点击领取今天的签到奖励!
恭喜!您今天获得了{{mission.data.mission.credit}}积分
我的优惠劵
-
¥优惠劵使用时效:无法使用使用时效:
之前
使用时效:永久有效优惠劵ID:×
没有优惠劵可用!















