Model Evaluation

Model Evaluation taxonomy generated by the site skill importer.

5 个技能
A
agentic-engineering

作者 affaan-m

了解 agentic-engineering 技能,掌握以评估先行的执行方式、任务拆分、模型路由以及带回归检查的更安全工作流自动化。

工作流自动化
收藏 0GitHub 156k
A
prompt-governance

作者 alirezarezvani

prompt-governance 是一个 Claude skill,用于将生产环境中的 prompts 作为可版本化、可评审、可测试的资产来管理。可用于规划 prompt registries、回归测试、A/B 实验、eval pipelines、发布审批以及 AI 功能的回滚流程。

提示词治理
收藏 0GitHub 22.2k
A
senior-prompt-engineer

作者 alirezarezvani

senior-prompt-engineer 是一个不绑定具体模型的 Prompt Writing 技能,适用于以 eval 驱动的提示词优化、RAG 质量检查、agent 工作流验证,以及 token/成本预算。它包含参考资料,并提供用于提示词分析、RAG metrics 和 agent orchestration 的 Python tools。

提示词写作
收藏 0GitHub 22.1k
A
senior-data-scientist

作者 alirezarezvani

senior-data-scientist 是一个面向 Machine Learning 的 Claude skill,适用于 A/B test 设计、因果推理、特征工程和表格型 ML 评估。它可用于辅助样本量估算、指标选择、数据泄漏检查、SHAP 审阅以及类似 MLflow 的跟踪;其中的脚本是脚手架模板,并不是完整引擎。

机器学习
收藏 0GitHub 22.1k
A
llm-patterns

作者 alinaqi

llm-patterns 可帮助你设计 AI 优先的应用逻辑:由 LLM 负责推理、抽取和生成,由代码负责校验、路由和错误处理。使用 llm-patterns 技能,可获得更清晰的 prompt 结构、可测试的 LLM 工作流,以及面向 Skill Authoring 的实用指导。

Skill 编写
收藏 0GitHub 607