Data Engineering

Data Engineering taxonomy generated by the site skill importer.

12 skills
A
clickhouse-io

bởi affaan-m

clickhouse-io là một skill tập trung vào ClickHouse cho thiết kế schema, SQL phân tích, mẫu nạp dữ liệu và tối ưu hiệu năng. Hãy dùng nó để định hướng lựa chọn MergeTree, phân vùng, materialized views và tối ưu truy vấn theo từng khối lượng công việc cụ thể.

Database Engineering
Yêu thích 0GitHub 156.1k
C
Snowflake Automation

bởi ComposioHQ

Snowflake Automation giúp agent dùng Composio MCP để khám phá database Snowflake, duyệt schema và bảng, chạy SQL, đồng thời quản lý các quy trình kỹ thuật dữ liệu với ngữ cảnh về role, warehouse, filter, timeout và an toàn.

Database Engineering
Yêu thích 0GitHub 67.5k
C
big-data-cloud-automation

bởi ComposioHQ

big-data-cloud-automation giúp agent tự động hóa các tác vụ Big Data Cloud thông qua Composio Rube MCP bằng cách khám phá schema công cụ hiện tại, kiểm tra kết nối và lập kế hoạch thực thi an toàn hơn.

Workflow Automation
Yêu thích 0GitHub 67.4k
W
airflow-dag-patterns

bởi wshobson

airflow-dag-patterns giúp thiết kế Apache Airflow DAG sẵn sàng cho production với các pattern tác vụ, phụ thuộc, operators, sensors, kiểm thử và hướng dẫn triển khai tốt hơn cho các job chạy theo lịch.

Scheduled Jobs
Yêu thích 0GitHub 32.6k
W
data-quality-frameworks

bởi wshobson

Skill data-quality-frameworks giúp các nhóm lập kế hoạch kiểm định dữ liệu production bằng dbt tests, Great Expectations và data contracts. Hãy dùng skill này để chọn đúng loại kiểm tra, ánh xạ chúng vào testing pyramid và định hướng quy trình data quality sẵn sàng cho CI/CD nhằm phục vụ Data Cleaning và tăng độ tin cậy của pipeline.

Data Cleaning
Yêu thích 0GitHub 32.6k
W
dbt-transformation-patterns

bởi wshobson

dbt-transformation-patterns giúp agent tổ chức dự án dbt theo các lớp staging, intermediate và marts, đồng thời đưa ra hướng dẫn về testing, tài liệu hóa và mô hình incremental. Hãy dùng skill này để lên kế hoạch cài đặt, dựng khung repo mới hoặc tái cấu trúc SQL theo các pattern analytics engineering gọn gàng hơn cho các nhóm Database Engineering.

Database Engineering
Yêu thích 0GitHub 32.6k
W
spark-optimization

bởi wshobson

spark-optimization là hướng dẫn thực tiễn để chẩn đoán các job Apache Spark chạy chậm, tập trung vào partitioning, shuffle, skew, caching và tinh chỉnh bộ nhớ. Hãy dùng hướng dẫn này để cài skill từ wshobson/agents, đọc SKILL.md và áp dụng các cách khắc phục dựa trên bằng chứng từ dấu hiệu trong Spark UI, cấu hình cluster và mẫu truy vấn.

Performance Optimization
Yêu thích 0GitHub 32.6k
A
chief-data-officer-advisor

bởi alirezarezvani

chief-data-officer-advisor là một skill CDO chiến lược cho các quyết định dữ liệu ở startup: quyền sử dụng dữ liệu huấn luyện AI, chiến lược warehouse vs lakehouse vs mesh, định giá tài sản dữ liệu khách hàng, mức độ sẵn sàng cho M&A và tuyển dụng đội ngũ dữ liệu. Skill có tài liệu tham chiếu và công cụ Python để hỗ trợ ra quyết định, không dành cho kỹ thuật dữ liệu triển khai hằng ngày.

Strategic Planning
Yêu thích 0GitHub 22.1k
A
cdo-review

bởi alirezarezvani

cdo-review là skill rà soát theo vai trò Chief Data Officer, dùng để thử áp lực các kế hoạch chiến lược dữ liệu, quyền sử dụng dữ liệu huấn luyện AI, lựa chọn kiến trúc, thương mại hóa dữ liệu thành sản phẩm, thẩm định M&A và tuyển dụng đội ngũ dữ liệu trước khi cam kết.

Strategic Planning
Yêu thích 0GitHub 22.1k
M
data-analytics

bởi markdown-viewer

Skill data-analytics tạo các sơ đồ PlantUML cho quy trình phân tích dữ liệu, bao gồm ETL, ELT, data lake, warehouse, pipeline streaming, phân tích log và dashboard BI. Skill này được tối ưu để thể hiện luồng nguồn-đích rõ ràng, dùng stencil phân tích/cơ sở dữ liệu AWS và cho ra nội dung hướng dẫn data-analytics thực tiễn — không phải sơ đồ phần mềm hay kiến trúc cloud chung chung.

Data Analysis
Yêu thích 0GitHub 1.1k
T
tinybird-python-sdk-guidelines

bởi tinybirdco

tinybird-python-sdk-guidelines giúp bạn cài đặt và sử dụng tinybird-sdk cho các dự án Tinybird viết bằng Python. Skill này bao quát datasources, endpoints, clients, connections, chuyển đổi từ các file cũ, cùng quy trình phát triển backend với hướng dẫn build và deploy.

Backend Development
Yêu thích 0GitHub 16
K
lamindb

bởi K-Dense-AI

Skill lamindb giúp bạn làm việc với LaminDB, một framework dữ liệu sinh học mã nguồn mở để biến dữ liệu thành dạng có thể truy vấn, truy vết, tái lập và tuân thủ FAIR. Dùng nó cho lamindb trong Phân tích dữ liệu, biên soạn metadata, chú thích dựa trên ontology, kiểm tra schema và các quy trình làm việc có nhận biết lineage trên notebook và pipeline.

Data Analysis
Yêu thích 0GitHub 0