GMNER 图文数据合成
Twitter-FMNERG 有 44 个细粒度类。按样本占比 5% 切开:seen 6 类,unseen 38 类。unseen 在训练集里没有任何带定位的样本,只有标签语义可用。
一条 GMNER 样本要同时标实体、类型和图像框,补标注很贵。但类别名字是已知的——模型知道 singer 对应什么样的人和场景。问题是:不加人标的前提下,怎么把这种先验变成实体、类型、文本、定位四者对齐的监督。基线 unseen F1 只有 2.80。
- Planner / 定位生图 / Sentence 三模块,给 38 个类合成带定位监督
- 实体定位头和 SD3.5 注意力 LoRA 一起训,图和框同时出
- Sentence 退化句用 GRPO 压:实体出现、重复、句长做 reward
- 1000 条并入后样本还少 68,unseen F1 到 28.64