哪些 API 会标记 AI 内容?16 个 SKU 对照 10 项法规实测
目录
目前,6 个司法辖区和美国 4 个州要求在 AI 生成媒体文件中加入机器可读标记。我们通过 16 个 API SKU(单独计价的模型变体)生成了图像、视频和语音,并直接检查返回文件的字节内容:7 个带有 C2PA 清单,4 个带有中国的隐式标识,没有一个同时包含两者,视频和音频 SKU 则完全没有标记。随后,我们用常规图像处理流程处理这些文件。在测试的两个图像库中,所有 C2PA 清单都在第一次重新编码、调整尺寸或裁剪时丢失。本文实测这些缺口具体出现在哪里,以及补齐它们需要多少成本。
TL;DR
- 11 个图像 SKU 中有 7 个嵌入 C2PA(OpenAI、ByteDance);4 个嵌入中国隐式标识(Alibaba);没有一个同时嵌入两者。
- 视频 SKU 和全部 4 个语音 SKU 返回的文件完全没有标记,但欧盟和加州的规则都涵盖音频与视频。
- OpenAI 的签名可通过官方 C2PA 信任列表验证;ByteDance 的签名有效但不受信任,因为其证书链指向的根证书不在该列表中。
- 所有 C2PA 清单经过任何转换后都会丢失;中国标识在 ImageMagick 的 PNG 到 PNG 处理中可以保留,在 Pillow 中无法保留,而且两者都无法跨格式保留。
哪些规则确实要求文件内部带有标记?
真正深入文件字节层面的法规,远少于 AI 立法的总体数量。大多数 AI 内容法规只要求提供人类可见的标签,或在合成媒体造成伤害时下架内容。下表中的规则直接要求文件本身包含标记,因此 API 用户需要在生成阶段满足这些要求。以下是对所引用文本的工程解读,不构成法律分析。法律层面可先参考欧盟委员会关于第 50 条的指南和 IAPP 全球 AI 立法追踪器。
| 制度 | 文件必须包含的内容 | 生效时间 |
|---|---|---|
| 《欧盟人工智能法案》第 50(2) 条 | “采用机器可读格式”的标记;未指定具体技术,《行为准则》同样保持技术中立 | 2026-08-02 |
| 中国《人工智能生成合成内容标识办法》+GB 45438-2025 | 元数据中必须包含具有规定字段的隐式标识(内容制作服务提供者编码、内容编号、签名),并添加显式标识;这是唯一规定自有 schema 的制度,也是唯一已经开始执法的制度 | 2025-09-01 |
| 印度《信息技术规则》G.S.R. 120(E) | 可见标签,以及“永久元数据或其他适当的技术来源机制……包括唯一标识符” | 2026-02-20 |
| 越南《人工智能法》第 11(2) 条 | 音频、图像和视频须“采用机器可读格式进行标记”;未规定具体技术 | 2026-03-01 |
| 哈萨克斯坦《人工智能法》第 21(2) 条 | 机器可读标记;模拟人物或事件的内容还需添加可见警告 | 2026-01-18 |
| 韩国《人工智能基本法》第 31 条 | 运营方可选择人类可感知标记或机器可读标记;宽限期延续至 2027 年 | 2026-01-22 |
| 美国:加州,随后是康涅狄格州、犹他州、华盛顿州 | 文件中携带“潜在披露”(latent disclosure,即写入文件而非显示在屏幕上):提供者、系统名称和版本、时间和日期、唯一标识符;加州还要求提供免费的公共检测工具。适用于月活用户超过 100 万的提供者 | 2026-08-02 至 2027 年 |
其他地区要么只要求人类可见的标签,要么没有相关要求:美国超过 30 个州要求为选举深度伪造内容添加免责声明,但美国联邦法律、英国、日本、澳大利亚和新加坡都没有通用标记义务。(有两点容易误判:挪威目前尚不适用第 50 条,因为《人工智能法》还未纳入《欧洲经济区协定》;意大利 2025 年的 AI 法律并不包含标记义务,尽管大量报道声称存在此类要求。)
从工程角度可以得出三点。首先,各制度的规定方式互不兼容:欧盟不指定格式,中国规定了自己的 schema,印度和越南要求提供来源信息,却不说明具体形式。其次,大多数西方厂商采用的 C2PA 几乎没有被成文法明确指定:只有康涅狄格州和华盛顿州点名要求 C2PA,没有任何国家级制度这样做。最后,5 个立法机构明确要求标记具备持久性,使用的表述包括“难以篡改、删除或与内容分离”(康涅狄格州)、“难以删除或篡改”(华盛顿州)、“永久元数据”(印度)、“篡改可检测”(犹他州的选举广告法),以及“永久或无法轻易删除”(科罗拉多州)。下文的转换测试会衡量现有技术与这些要求之间的差距。
C2PA 标记在文件中到底是什么?
它是一段加入文件的签名 JSON 数据块,图像本身看不到任何变化。C2PA 由内容来源与真实性联盟制定,在其技术规范中定义了一种“清单”:记录资产由谁、通过什么方式创建,并使用密码学签名,以便检测篡改。在 PNG 中,它以独立 chunk 的形式与像素数据并列存在。遍历一张生成图像的 chunk 后,可以清楚看到它的位置和体积开销:
IHDR 13 bytes image header
caBX 21,767 bytes C2PA manifest store <- the mark
IDAT 2,115,575 bytes the actual pixels
IEND 0 bytes
一张 2 MB 的图像会增加约 22 KB,大约占 1%,并且不修改任何像素。因此,图像在任何查看器中看起来都完全相同。只有主动检查 C2PA 的软件才会显示“内容凭证”徽章。
验证器从 OpenAI 图像中读取的清单如下。这里删减到决定其含义的字段:
{
"claim_generator_info": [{ "name": "OpenAI Media Service API" }],
"signature_info": {
"issuer": "OpenAI OpCo, LLC",
"time": "2026-08-22T13:47:29Z"
},
"assertions": [{
"label": "c2pa.actions.v2",
"data": { "actions": [{
"action": "c2pa.created",
"when": "2026-08-22T00:00:00Z",
"softwareAgent": { "name": "gpt-image", "version": "pre-2.0" },
"digitalSourceType": ".../digitalsourcetype/trainedAlgorithmicMedia"
}]}
}]
}
真正起作用的是三部分。操作字段说明资产是被“创建”的,而不是编辑而来;digitalSourceType: trainedAlgorithmicMedia 是 IPTC 词汇表中表示“由生成式模型制作”的术语,也就是实际以机器可读形式声明“这是 AI 内容”的字段。软件代理字段给出模型名称。签名将所有信息绑定到证书上,验证器可以据此判断声明是否被修改,以及由谁为它背书。
中国的隐式标识由与《标识办法》同步发布的强制性国家标准 GB 45438-2025 定义。它无需签发机构,以纯文本 JSON chunk 解决同一个问题:
{ "Label": "1",
"ContentProducer": "001191330106MA2CFLDG4R10001",
"ProduceID": "U-9TlH0PCIQomj9MzIc5VUuQ",
"ReservedCode1": "K-LBkc9peJ0Gox..." }
Label: 1 表示内容由 AI 生成,ContentProducer 是提供者注册的公司编码,ProduceID 是厂商生成的内容编号,ReservedCode 则是签名值。两者目标相同,但信任模型不同:C2PA 由证书颁发机构为声明背书;中国标识指向已注册公司,由需要验证的一方自行核验。
API 实际嵌入了什么?
11 个图像 SKU 中,7 个嵌入 C2PA,4 个嵌入中国隐式标识,而且完全按厂商阵营划分:
| SKU | 格式 | C2PA | 中国隐式标识 | 创建时间戳 |
|---|---|---|---|---|
| gpt-image-1、1-mini、1.5、2 | PNG | 有 | 无 | 仅日期,00:00:00Z |
| seedream-4.0、4.5、5.0 | JPEG | 有 | 无 | 精确到秒 |
| qwen-image-2.0、2.0-pro | PNG | 无 | 有 | 无 |
| wan2.7-image、2.7-pro | PNG | 无 | 有 | 无 |
| seedance-1.5-pro(视频) | MP4 | 无 | 无 | — |
| tts-1、qwen3-tts、google-tts-standard、chirp3-hd | MP3 / WAV | 无 | 无 | — |
采用 C2PA 的两类厂商都写入了上文所示的相同字段,即 c2pa.created 和 trainedAlgorithmicMedia。采用中国标识的两家厂商也都输出相同的 GB 45438 结构,但多了一项:另一组字段用于标识文件的传播服务提供者。比表格中的“有”或“无”更关键的是以下三点。
**这些签名的信任级别并不相同。**验证分为两步:先读取清单,再检查签名证书能否连接到 C2PA 信任列表中的根证书。标准验证器默认不信任任何证书,因此所有文件都会报告 signingCredential.untrusted,有效文件也不例外。要进行大规模验证,第一步就是加载官方信任列表。加载后,OpenAI 图像会被判定为可信,因为其签发 CA 是列表中 17 个实体之一。ByteDance 则不会:其清单使用 GlobalSign 的 S/MIME 中间证书签名,这类证书原本用于电子邮件,对应根证书不在该列表中。按照规范术语,ByteDance 的清单是“有效的”(签名验证通过,图像自签名后未被修改),但“不受信任”,因此合规验证器不会为声明主体的身份背书。
**OpenAI 的时间戳没有具体时间。**所有 OpenAI 清单都写入 2026-08-22T00:00:00Z,也就是生成日期当天的午夜;ByteDance 则记录实际秒数。降低时间精度可以用于保护隐私,但加州的潜在披露要求提供“时间和日期”,因此应让法律顾问评估仅记录日期是否满足要求。
音频和视频文件中没有任何标记。《欧盟人工智能法案》和加州规则都涵盖合成音频与视频。这并非格式限制,因为 C2PA 规范支持使用 MP4、WAV 和 MP3 作为载体。我们生成的 MP4 只有标准 QuickTime 容器字段,没有其他标记;4 个语音文件也只有编解码器头。图像通过 base64 或 URL 返回时,标记内容完全一致,因此交付链路既没有添加来源信息,也没有将其删除。
这些标记能否经受常规处理?
C2PA 清单在所有测试中都会丢失。中国标识能否保留,则取决于图像工具是否复制文本 chunk。我们分别通过 Python 的 Pillow 和 ImageMagick,对 3 个已标记文件执行相同的 5 种操作:OpenAI 的 C2PA 图像、ByteDance 的 C2PA 图像,以及 Alibaba 的中国标识图像。
| 转换操作 | C2PA(OpenAI) | C2PA(ByteDance) | 中国标识(Alibaba) |
|---|---|---|---|
| 按字节复制 | 保留 | 保留 | 保留 |
| 重新编码为 PNG | 丢失 | 丢失 | 取决于工具 |
| 尺寸缩小至 50% | 丢失 | 丢失 | 取决于工具 |
| 裁剪 10% | 丢失 | 丢失 | 取决于工具 |
| 转换为 JPEG q90 | 丢失 | 丢失 | 丢失 |
| 转换为 WebP q85 | 丢失 | 丢失 | 丢失 |
Pillow 在所有操作中都会丢失所有标记,15 次测试中保留 0 次。ImageMagick 保留了 15 次中的 3 次,全部是 PNG 到 PNG 操作中的中国标识。原因不是图像质量:即使重新编码为无损 PNG,C2PA 清单也会像转换成有损 JPEG 一样彻底消失。
这种差异的原因很简单。中国标识使用普通 PNG 文本 chunk(tEXt,用于存放键值字符串的标准位置),因此会复制文本 chunk 的工具可以直接保留它。ImageMagick 默认这样做;Pillow 只有在明确要求时才会复制。C2PA 清单位于主流图像工具无法识别的自定义 chunk 中,因此无论是否要求工具保留元数据,它都会被删除:ImageMagick 在普通尺寸调整时会删除它,显式传入包含所有 chunk 的参数后仍然如此。两种标记都无法跨格式保留,因为 PNG 文本 chunk 在 JPEG 或 WebP 中没有对应位置。
因此,实际规则不能只概括为“元数据很脆弱”。必须转换时,如果始终使用同一种格式,并选择会保留文本 chunk 的库,中国标识可以继续存在。C2PA 在普通工具中没有可行的保留路径。受支持的做法是转换后重新签名。这虽然可行,但声明主体会发生变化:新清单会将你的处理流水线列为签名者,而不是模型厂商;在你的证书加入信任列表前,它也会被判定为不受信任。
再看前文 5 项法规对持久性的表述。缩略图服务、CDN 转换、清理 EXIF 的隐私处理,甚至用户截图,都会删除这些标记。因此,法律指向的技术本身无法提供其要求的持久性。能经受这些处理的是嵌入像素的不可感知水印。Google 的 SynthID 部署范围最广,但没有公开检测器,检查门户也只能排队申请,所以第三方无法确认文件中是否存在 SynthID。从文件中可以验证的只有元数据层。在两个库、三种标记的测试中,只有一种组合能在转换后保留:ImageMagick 配合中国标识。
既然标记迟早会丢失,还有必要提供吗?
有必要,因为关键平台会在标记仍然存在的唯一时刻读取它:上传时。即使清单无法通过你的缩略图服务,它仍会在原始文件提交给平台时被读取。平台为帖子添加的标签则会长期保留,完全不依赖文件中的元数据。
| 平台 | 上传时读取什么 | 处理方式 |
|---|---|---|
| TikTok | 自 2024 年 5 月起读取 C2PA 内容凭证 | 自动标记由其他工具生成的 AI 内容;还会为 TikTok 内容附加自己的凭证,且该凭证“在内容下载后仍会保留” |
| YouTube | C2PA 元数据,以及创作者主动申报 | 自动标记“包含 C2PA 元数据的内容”;创作者如果持续不披露,平台可强制添加标签、删除内容,或暂停其加入合作伙伴计划 |
| Meta | C2PA 和 IPTC 指示信息,以及分类器和主动披露 | 添加“AI 信息”标签 |
| 仅 C2PA 清单,没有自有检测器 | 显示内容凭证徽章 | |
| X | 其真实性政策未说明会读取来源信息 | 依靠分类器和用户举报执行规则 |
这会改变工程结论。元数据层不是文件的持久属性,而是你向原始字节接收方发送的一次性信号。提供它后,TikTok 和 YouTube 会将它转换为保存在平台数据库中的标签,而不是继续依赖 PNG 中的元数据。省略它,就只能让平台的分类器猜测内容来源。这里有两个限制:这些平台都没有说明对外提供的文件是否仍保留清单,我们也没有测试;X 则完全没有公开说明会读取来源信息。
API 返回的文件没有标记时,该怎么办?
你需要自行添加,真正的问题是能添加哪一层,以及应该在哪里添加。我们实测了元数据方案:为一张未标记的 Alibaba 图像签署自己的 C2PA 清单耗时 59 ms,文件体积增加约 8%,从 1.18 MB 增至 1.28 MB。新清单通过 trainedAlgorithmicMedia 声明 c2pa.created,并写入上游模型名称。它可以与文件中已有的中国标识共存,因此即使没有厂商同时提供两种体系,同一个文件仍然可以同时携带两者。需要注意两点:我们使用自签名证书,清单与 ByteDance 的情况相同,会被判定为不受信任;重新编码后,新标记也会和厂商标记一样立即丢失。
| 补救措施 | 解决什么问题 | 成本 | 脆弱性 |
|---|---|---|---|
| 生成后离线签署 C2PA 清单 | 欧盟的机器可读标记要求;如果填写提供者、版本、时间和标识符,也可满足加州的潜在披露要求 | 59 ms,文件体积增加 8%,另需获得受认可签发机构颁发的证书 | 任何重新编码都会丢失 |
| 在 API 交付路径中注入清单 | 与上项相同,但统一应用 | 操作相同,只是执行位置前移 | 相同 |
| 将可见标签直接绘制到像素中 | 加州的屏幕可见方案(法条称之为 “manifest disclosure”,与 C2PA 的 manifest 无关)、中国的显式标识 | 一次图像合成 | 可经受所有处理,但会改变图像 |
| 按内容哈希保存生成日志 | 合规证据、中国要求的六个月留存义务 | 需要存储,无单文件处理开销 | 不依赖文件 |
| 不可感知水印 | 可经受转换的一层 | 有开源编码器,但没有互操作标准,因此其他人无法验证你的水印 | — |
离线签名和在 API 路径中签名,对同一组字节执行的是同一个操作,区别在于签名指向谁。在 gateway 签名,表示由 gateway 证明文件来源;在应用内签名,则由你使用自己的证书和密钥托管体系完成证明。如果你的义务是披露产品使用 AI 生成了内容,就应该在承担该义务的位置完成证明。
还有一项控制措施不需要修改文件,却最容易被团队忽略:生成日志。中国要求,提供未添加显式标识内容的服务提供者保留接收方记录至少六个月,而所有 API 实际上都属于这种情况。文件一旦进入处理流水线,日志也是证明合规的依据。如果你已经记录 request ID、模型和时间戳,通常缺少的是交付字节的哈希。补上后,即使文件后来丢失元数据,仍能与日志记录对应起来。
常见问题
中国图像模型会标记输出吗?
会,但不是使用 C2PA。Alibaba 的 qwen-image 和 wan2.7 SKU 会嵌入 GB 45438-2025 规定的隐式标识,其中包含内容制作服务提供者的注册公司编码、内容 ID 和签名值。ByteDance 的 seedream SKU 正好相反:嵌入 C2PA,但不包含中国标识。在 11 个图像 SKU 中,没有一个同时嵌入两者。
流水线调整图像尺寸后,C2PA 标记还能保留吗?
不能。通过主流图像工具处理时,Pillow 和 ImageMagick 调整尺寸都会删除 C2PA 清单。该清单位于自定义 chunk 中,两个工具都会将其丢弃,即使显式要求保留所有 chunk 也一样。唯一受支持的方案是为转换后的文件重新签名,这会让你的流水线成为签名者。中国标识使用普通 PNG 文本 chunk,ImageMagick 默认会保留,Pillow 在显式复制时也能保留;但转换为 JPEG 或 WebP 后,两者都会丢失。
API 输出没有标记,会给我带来合规问题吗?
未标记文件是否属于你的责任,取决于你在适用制度下属于提供者还是部署者,这需要法律顾问判断。实测结果可以确定事实层面:如果你通过这些 API 生成语音或视频,或者面向欧盟用户使用 Alibaba SKU 生成图像,文件中没有任何欧洲验证器能够识别的标记,需要由你自行添加。
测试于 2026-08-22 通过 Synthorai gateway 完成:11 个图像 SKU 各生成 2 次,并分别通过 base64 和 URL 交付;另测试 1 个视频 SKU 和 4 个文本转语音 SKU。所有文件均检查 C2PA 清单、IPTC 和 XMP 字段,以及 GB 45438 标识 chunk。验证 C2PA 签名时加载了官方信任列表,并同时使用公共内容凭证验证器采用的临时列表进行验证。持久性测试针对每个标记体系各选取 1 个文件,分别通过 Pillow 和 ImageMagick 执行 5 种操作(PNG 重新编码、调整尺寸、裁剪、转换为 JPEG、转换为 WebP),并启用各库的元数据保留选项。补救成本来自为未标记图像签署自有清单,并在转换前后重新检查文件。法规部分是对引用文本的工程解读,不构成法律意见;厂商可能在不通知的情况下调整标记行为,因此依赖任何一行数据前都应重新测试。
同系列相关文章:图像生成成本、Qwen-Image 3.0 实测、视频生成定价、语音 Agent 成本。