Skip to main content

关键结论

多图融合同样对于设计 agent 的图像理解、复杂推理、视觉校验、审美判断等有极强的要求,这里实测了多图融合场景下豆包与 AmosMind 的对比,豆包在该场景下已经完全不可用,而 AmosMind 依然精准的完成了任务。

🙌 原图 + 提示词

Image
Image
Image
Image
Image
Image
Image
Image
以图一「手持手机的男性」为核心:
  • 让图中的男生的手表换成图二的
  • 手机换成图三的
  • 衣服换成图四的
  • 底部的 icon 换成图五的
  • 整个人物的面部特征和发型换成图六的
  • 带上图七的耳钉
  • 手指的中指上带上图八的戒指

😈 豆包 agent 融合的结果:

Image
豆包:低于 60 分
  • 多处错误,包括人物的脸部被严重遮挡,多个物品细节被更改 ❌
  • 严重违背提示词意图,完全不可用 ❌

😈 豆包 agent 第二次融合的结果:

Image
豆包:60 分,由于任务比较复杂,让豆包第二次进行了尝试
  • 但输出的结果问题甚至更加严重 ❌
  • 且严重违背了提示词的意图 ❌

🤩 AmosMind 融合的结果:

Image
AmosMind:95分
  • 完美的理解了所有的提示词意图 ✅
  • 精准符合提示词意图,且人物形象较佳 ✅