中国移动通信集团有限公司数智事业部 | 项目经理(软件运维岗) (已认证)
一、现状与背景 云原生、微服务、分布式架构深度普及,业务链路高度复杂,单次请求可穿越数十至数百个异构组件,故障呈现多模态、强耦合、非线性、瞬时突变特征,传统...
核心摘要:在云原生、分布式、微服务深度普及的今天,运维正从被动响应走向主动预防、智能自治,数据底座已成为AI+运维落地的核心基石。本文结合某央国企多智能体立体运...
依据CNCF《2023-2024全球云原生可观测调研报告》及OpenTelemetry官方规范,四类数据各有适用边界,无法独立覆盖全维度系统状态:
关注SRE工程化、AI+运维实践落地,点击上方“数智化运维探索”关注公众号,获取更多行业经验分享。
云原生分布式架构下故障具备链路耦合、告警风暴、渐变隐性、跨域割裂四大特征,传统人工分段处置模式存在全流程断点,MTTD/MTTA/MTTR居高不下,极易引发业务...
云原生、微服务、分布式架构规模化普及,IT 资源体量呈指数级增长;传统定时脚本 + 人工巡检属于被动式事后运维,已成为系统稳定性核心瓶颈。 AIOps 进入 L...
AI 应用上线后,经常会遇到一种尴尬情况:用户反馈“等了很久”,服务端日志却只有一条请求开始和一条请求结束。中间到底卡在 Prompt 渲染、Chain 编排、...
教训:日志平台不是把日志接进来就结束了。日志能不能查、能不能关联、能不能告警、出了事能不能定位到人,才是它真正的价值。
现在搭一个 Agent 框架,标准流程是先写聊天循环,加工具调用,加规则约束,最后补一层日志看看生产环境发生了什么。日志是副产物,是事后补的审计工件。Nakaj...
Meta: Sorry, your request failed. Please try again. #2531369 给出了一些解决方案,如重试请求、更换模...
本文针对企业传统运维告警泛滥、故障定位慢、人工运维成本高等痛点,梳理AIOps完整技术栈选型标准,搭建指标采集、异常检测、根因分析、自动处置一体化运维平台,配套...
传统AIOps依赖固定规则与传统机器学习模型,对非结构化日志、模糊故障场景识别能力有限。大模型具备自然语言语义理解、多源数据推理、流程自动编排能力,能够打通监控...
比如日志系统,如果日志结构清晰、链路信息完整,AI 就可以帮助我们更快总结异常现象、定位错误模式、给出排查建议。监控预警系统如果能关联发布记录、配置变更、服务依...
Agent 越智能,每一步往上下文里塞的东西就越多。日志、代码搜索结果、RAG 片段、文件内容、历史消息……模型真正仔细看完的,可能还不到一小半。
说句可能得罪人的话:一个人玩 Codex 和一家公司用 Codex,根本是两件事。
日志量为什么突增?回头看监控,1:30有个CronJob触发数据同步任务,每秒打印上万行DEBUG日志,日志量瞬间打到平时50倍。
运行上面的Python代码,根据提示先后输入问题内容“我叫张三”、“我叫什么?”,输出日志结果如下:
海量分布式日志分词解析与时间精度全域优化技术方案 一、方案概述 在云原生、微服务、分布式架构深度落地的数字化场景下,系统日志已成为故障溯源、链路观测、性...
命令执行后,CLI 会实时输出流水线状态和日志;同时你也可以在 Dashboard 的「执行历史」中看到刚刚触发的 hello-world 任务,点击进入即可查...