OevuAI Image Training Corpus
面向大模型视觉训练的人工标注图像–文本配对语料。标注体系采用双轨制:密集中文标签列表与结构化双语描述,题材覆盖城市场景、自然风光、人像肖像、商业静物与文字版式。
Overview
大模型的视觉能力取决于训练语料的标注密度与语义准确性。通用爬取语料规模大但噪声标注多、中文语义覆盖弱;本数据集以「小规模、高质量、强标注」为建库原则,优先保证每一组样本的标注密度、术语一致性与可审计性。
图像来源包括创建者实地采集(移动设备拍摄)与受控生成两类,均经人工筛选去重。每幅图像配备同名 .txt 标注文件,解压即可接入主流训练管线,无需额外格式转换。本页面公开 12 张分层抽样样本与全部统计;完整 79 组数据通过 Request access 发放。
Dataset statistics
| Field | Value |
|---|---|
| 79 pairs | 79 组图像–标注配对 |
| 79(28 PNG + 51 JPG) | 图像文件,同名 .txt 标注 79 份 |
| 12–70 tags / 图,均值 28.6 | 密集标签子集 n = 57 |
| 2 | 密集标签列表 57 组;结构化双语描述 22 组 |
| 1080×1440 – 4096×3072 | 6 档主要分辨率,详见 Distribution |
| 4:3 ×55 · 3:4 ×22 · 超宽 ×2 | 4:3 占 69.6%,3:4 占 27.8% |
| ≈ 298 MB | 原始分辨率交付,压缩包 297,379,369 bytes |
Annotation
100% Human annotated — manually annotated by the dataset creator
标注体系:双轨制
第一轨 · 密集标签列表(57 组):以逗号分隔的中文标签序列刻画图像,覆盖主体对象、环境要素、布光手法、构图方式与质感描述五个层级。示例(真实标注节选):
商务肖像照,男士人像摄影,棚拍人像,影棚拍摄,伦勃朗布光,伦勃朗光,三角光,专业人像灯光,单灯布光,主光侧前方45度,面部形成三角光区,立体感强,光影对比强烈,硬光质感,深灰渐变背景……
第二轨 · 结构化双语描述(22 组):采用 text–label 字段结构。text 为中文自然语言长描述,完整叙述画面内容、光影关系与风格氛围;label 为对应的英文标签序列。示例(真实标注节选):
text:室内餐厅场景,特写视角拍摄一碗牛肉面。碗为米白色陶瓷碗,边缘带黑色描边,置于深色木质餐桌上……
label:food photography, beef noodle soup, hand-pulled noodles, braised beef chunks, dark brown beef broth, ceramic bowl with black rim, wooden table, warm indoor lighting…
质量控制(如实说明)
本版本由数据集创建者单人标注,标注完成后由标注者本人进行一轮自查(语义准确性与格式一致性)。本版本未做跨标注者一致性检验,这是当前标注协议的已知边界,详见下方 Known limitations。
Known limitations
- 单标注者产出,标注偏好与主观判断未做跨标注者一致性检验。
- 题材分布有意向城市场景倾斜(53.2%),不构成全题材均衡语料。
- 英文标签仅存在于结构化双语子集(22 / 79)。
- 标注形式为标签与自然语言描述,不含 bounding box / mask / keypoint。
- 公开页面仅展示 12 张抽样样本;完整 79 组通过申请发放。
Examples
从六个题材类别分层抽取的 12 组公开样本。图像缩略至 1000 像素以内;标注文本为完整节选原文。使用左右方向键或按钮浏览。
Distribution
题材构成分布(n = 79)
标注格式构成(n = 79)
单图标签数量分布(n = 57)
画幅比例分布(n = 79)
| Resolution | Count |
|---|---|
| 25 | 4096×3072 横幅 |
| 18 | 3072×4096 竖幅 |
| 28 | 1448×1086 受控生成 |
| 8 | 3000×4000 ×2 · 1080×1440 ×2 · 2880×2160 · 4000×3000 · 1440×655 · 4080×1836 各 1 |
Data provenance
Version history
| Version | Date | Change |
|---|---|---|
| 1.0.0 | 2026-10-06 | 首次发布:79 组图像–标注配对,双轨标注,含 12 张公开抽样样本。 |
Access
本数据集面向科研机构、高校实验室与企业研发团队开放申请。许可证条款正在评审中(License under review);申请通过后,通过专属渠道发放完整数据包及后续版本更新。使用本数据集发表成果时,请按以下格式引用:
OevuAI Large Model Laboratory. The OevuAI Image Training Corpus (Version 1.0.0) [DS/OL]. OevuAI, 2026.