Как автоматизировать карточки моделей и наборов данных: единая схема, генерация в CI/CD, публикация на Hugging Face Hub, что в них НЕ включать и как это связано с Приложением IV EU AI Act?
Production-grade автоматизация cards = schema-first + CI/CD-генерация + automated push. Hugging Face Hub spec требует YAML frontmatter (license, datasets, language, library_name, pipeline_tag, base_model, model-index для eval results) + Markdown body (Model Description / Uses / Bias-Risks-Limitations / Training / Evaluation / Environmental Impact с CO2eq). Google Model Card Toolkit даёт structured JSON schema. Datasheets for Datasets (Gebru 2018, updated 2021) — 57 вопросов по 7 разделам. Pipeline: training job → metrics export → pydantic-валидация → ModelCard.from_template() → card.push_to_hub() через GitHub Actions. НЕ включать: PII в training examples, customer-specific data, internal benchmark numbers без согласия, secrets. EU AI Act Annex IV (8 categories): cards покрывают ~60-70% overlap, но Annex IV — full regulatory submission, cards — public-facing summary.