Methodology
实验室当前各项工作(数据构建、标注、评测)的方法说明。本文档随方法演进更新,更新记录体现在数据集的 Version history。
1 · Dataset methodology
数据集以「小规模、高质量、强标注」为原则构建。图像来源分两类:
- 实地采集 — 数据集创建者以移动设备拍摄的中文语境真实场景(城市街景、社区环境、家居空间等);
- 受控生成 — 按标注规范生成的摄影类图像(影棚人像、静物、风光等),用于补足实地采集难以稳定复现的布光与构图条件。
两类来源的图像均经过人工筛选与去重,入选标准为:画面要素可被无歧义描述、标注信息量达到 schema 下限、无权限与隐私问题。
2 · Annotation methodology
v1.0 标注采用双轨制,两轨各自独立成文件:
- 密集标签列表 — 逗号分隔的中文标签序列,按「主体对象 → 环境要素 → 布光手法 → 构图方式 → 质感描述」五个层级展开;单图标签数 12–70 个,均值 28.6;适用于标签对齐预训练与条件生成。
- 结构化双语描述 — text–label 字段结构:text 为中文自然语言长描述(画面内容、光影关系、风格氛围),label 为对应英文标签序列;适用于指令微调与中英跨模态检索。
标注工作流:图像入集 → 分配标注轨道 → 逐层级枚举标签(或撰写长描述)→ 标注者本人自查(语义准确性与格式一致性)→ 入库。标注者为数据集创建者本人;v1.0 未做跨标注者一致性检验,标注工具为纯文本 sidecar 文件(.txt,与图像同名配对)。
3 · Evaluation methodology(规划中)
评测框架设计原则:每次运行保留完整配置与数据切分记录;结果以运行记录(run records)而非单一汇总分数发布;每项评测附带方法说明与已知局限。首个公开评测完成前,此处不给出任何数值结果。
4 · Versioning
数据集版本号采用 MAJOR.MINOR.PATCH:样本集合变化递增 MINOR;标注文本修订递增 PATCH;结构性变更(schema 调整、重新采集)递增 MAJOR。每个版本发布时更新发布包 SHA-256 与本页方法说明。
5 · Limitations
当前方法的已知局限(与数据集详情页 Known limitations 一致):单标注者偏差、题材分布向城市场景倾斜、英文标签仅覆盖结构化双语子集、标注不含空间标注(bounding box / mask / keypoint)。这些局限是采样与标注协议的结果,在使用数据集时应当纳入考虑。
6 · Reproducibility
本站全部统计数字均可从发布包复算:发布包 SHA-256 公示于数据集详情页(v1.0.0:42694f4e…588232);题材分布按标注文本语义分类统计;标签密度按逗号分隔标签计数;画幅与分辨率按图像文件头读取。公开样本的 SHA-256 一并公示,用于核对发放内容与页面描述的一致性。