Sre

Sre taxonomy generated by the site skill importer.

10 skills
W
python-observability

bởi wshobson

python-observability giúp bạn bổ sung structured logging, metrics, traces, correlation IDs và các mẫu bounded-cardinality cho dịch vụ Python, để gỡ lỗi production hiệu quả hơn và triển khai observability an toàn hơn.

Observability
Yêu thích 0GitHub 32.6k
W
slo-implementation

bởi wshobson

Dùng kỹ năng slo-implementation để xác định SLI, SLO, error budget và cảnh báo burn-rate cho công việc Reliability. Kỹ năng này giúp nhóm biến mục tiêu dịch vụ thành các chỉ số đo lường được, với ví dụ theo kiểu PromQL và hướng dẫn thực tế từ SKILL.md.

Reliability
Yêu thích 0GitHub 32.6k
W
distributed-tracing

bởi wshobson

Dùng skill distributed-tracing để thiết kế và diễn giải việc truy vết request giữa các microservice với Jaeger và Tempo. Nội dung bao quát kiến thức cài đặt cơ bản, khái niệm trace và span, các mẫu thiết lập Kubernetes, context propagation, cùng cách áp dụng thực tế cho observability và gỡ lỗi độ trễ.

Observability
Yêu thích 0GitHub 32.6k
W
postmortem-writing

bởi wshobson

postmortem-writing giúp các nhóm xây dựng báo cáo postmortem sự cố theo hướng không đổ lỗi, với mốc thời gian, phân tích nguyên nhân gốc rễ, các yếu tố góp phần, mức độ ảnh hưởng và hạng mục theo dõi có thể hành động sau sự cố ngừng dịch vụ hoặc tình huống suýt xảy ra lỗi.

Report Writing
Yêu thích 0GitHub 32.5k
W
on-call-handoff-patterns

bởi wshobson

Tìm hiểu skill on-call-handoff-patterns để bàn giao ca trực ổn định và đáng tin cậy. Dùng skill này để chuẩn hóa bàn giao sự cố, ghi lại vấn đề đang mở, thay đổi gần đây, trạng thái leo thang xử lý và các bước tiếp theo cho đội Reliability.

Reliability
Yêu thích 0GitHub 32.5k
W
incident-runbook-templates

bởi wshobson

incident-runbook-templates giúp các nhóm xây dựng runbook ứng phó sự cố có cấu trúc rõ ràng, với các bước phân loại ban đầu, giảm thiểu tác động, leo thang, truyền thông và khôi phục cho sự cố gián đoạn và Playbooks vận hành.

Playbooks
Yêu thích 0GitHub 32.5k
A
runbook-generator

bởi alirezarezvani

runbook-generator tạo bản nháp runbook vận hành cho dịch vụ bằng Python CLI và các template cho deployment, health checks, rollback, incident response, maintenance và validation. Hữu ích cho các nhóm SRE, DevOps và Technical Writing muốn chuẩn hóa quy trình trực on-call.

Technical Writing
Yêu thích 0GitHub 22.2k
A
observability-designer

bởi alirezarezvani

observability-designer giúp các đội SRE và platform thiết kế observability cho API và service, gồm tạo dashboard, phân tích cảnh báo nhiễu và dựng khung SLI/SLO gọn nhẹ bằng các script Python, mẫu và tài liệu tham khảo đi kèm.

Observability
Yêu thích 0GitHub 22.2k
A
vpe-advisor

bởi alirezarezvani

vpe-advisor là skill tư vấn vận hành dành cho VP of Engineering, tập trung vào delivery throughput của startup, sức khỏe hiring funnel, cấu trúc đội ngũ và kỷ luật production. Dùng các tài liệu tham chiếu và công cụ Python của skill này để phân tích DORA metrics, khoảng trống tuyển dụng, tín hiệu cần thêm manager, thực hành on-call và các đánh đổi trong hoạch định chiến lược.

Strategic Planning
Yêu thích 0GitHub 22.1k
M
conducting-post-incident-lessons-learned

bởi mukul975

Skill conducting-post-incident-lessons-learned giúp các nhóm Incident Response tổ chức đánh giá sau sự cố theo quy trình rõ ràng, xây dựng dòng thời gian dựa trên факт, xác định nguyên nhân gốc rễ, ghi lại điều đã hiệu quả và chưa hiệu quả, rồi biến mỗi sự cố thành các cải tiến đo lường được với người phụ trách, thời hạn và cập nhật playbook.

Incident Response
Yêu thích 0GitHub 0