神译局是36氪旗下编译团队,关注科技、商业、职场、生活等领域,重点介绍国外的新技术、新观点、新风向。
编者按:不少 AI 生成图片质感精致逼真,细节渲染到位,可总让人隐隐觉得违和。问题往往不是人体结构出错,而是画面违背现实物理逻辑。本文来自编译,希望对您有所启发。
很多 AI 生成的图片逼真感十足,纹理细腻,皮肤毛孔清晰可见,整体画面美感出众。但总感觉哪里不对劲。明明说不出问题在哪,心里却清楚这不是真实照片。问题在于,我们找错了破绽。我们不再盯着那些显而易见的低级错误,却也始终没有学会识别如今仅剩的深层漏洞。当下高阶 AI 生成的图像,肉眼可见的硬错误已经很少,破绽变得极为隐晦,只有结果,没有成因。
只有结果,没有成因
在真实照片里,每一处画面效果,都能找到对应的物理源头。这片阴影,来自某个物体;这片虚化,来自特定光圈与拍摄距离;眼球里的反光,来自某扇窗户。相机不会凭空创造,它只是记录现实因果所产生的结果。
生成式 AI 恰恰相反。它学习事物长什么样子,却不懂事物如何运转。它知道反光是什么模样、阴影是什么模样、人像虚化该是什么效果,但不明白这些现象为何会产生。于是 AI 会把光影效果随意绘制在好看的位置,完全无视现实世界里约束光影位置的物理规则。
这就是一切问题的根源,请记住这句话:AI 不懂因果关系,只懂相关性。AI 见过数百万张图片,知道眼睛通常会有高光、背景大多会虚化、眼镜一般带有反光。它只清楚哪些元素经常同时出现,却不明白何为因、何为果。 所以 AI 才会画出只有效果、没有成因的画面。对模型而言,根本不存在所谓的成因,只有经常成对出现的视觉元素。
这就是 2026 年 AI 图像的辨别特征,不再是一眼就能指出的明显瑕疵,而是完美的视觉效果,却缺少对应的现实成因。掌握这套辨别方法,你就不会再被 AI 生成图蒙骗。下面列举几个真实案例,从相对明显到极为隐蔽逐一解析。
眼睛是最先暴露破绽的地方
辨别优先看眼睛。这里最容易出现模型错误,却几乎没有人留意。
看这张图里的虹膜,瞳孔内部出现星形光斑。


眼睛里的星形高光,只能来自带特定造型的光源:环形灯、分格窗户、滤镜,本质属于反射。反射应当呈现在角膜,也就是眼球外层湿润的表面。虹膜处在角膜下方、房水内侧,虹膜本身不会反射光线,只会吸收、衍射光线。
这张图中,AI 想要绘制造型光源的反射,却错误把星形光斑刻在了虹膜内部,破坏了虹膜放射状的生理结构。高光被画到了本该属于它的下层位置。这个星形不在眼球表面,而是嵌进眼球组织。现实世界没有任何灯具可以形成这种效果,光线想要抵达这个位置,必须穿透一层本应阻隔光线的组织。
虹膜应当是规整圆形。一旦虹膜形态扭曲,基本可以判定图片存在问题。
眼球反光,是光源的实景快照
还有一个在摄影领域公认的关键点:眼球中的反光能够还原光源的真实位置。
眼神光的形状,完全对应发光物体本身——方形柔光箱、长方形窗户、环形补光灯。读懂眼球反光,就能还原整套布光方案。如果眼球反光对应的光源和人脸其余位置的光照相互矛盾,这张图片的真实感就直接崩塌。
这张帐篷内夜间自拍,就是典型案例。


首先能看到虹膜已经变形,但这还不是破坏超写实效果的全部原因,光照逻辑同样十分怪异。
额头正面光线生硬且强烈,这是闪光灯效果,无论是机顶闪还是手持闪光灯。闪光灯意味着相机带有热靴接口,结合人脸的压缩透视,相机应当使用 50 毫米或者更长焦距镜头。矛盾点就在这里——画面是手臂伸直的自拍视角,但能够实现这种成像效果的设备却是长焦单反。人的手臂长度根本达不到这个拍摄距离。产生这束强光的设备,不可能握在画面人物的手中。
还有一层只有常年接触测光设备的人才能察觉的细节。想要使用正面闪光灯,又不让人物在漆黑背景下显得生硬突兀,摄影会采用环境光与闪光灯平衡的技法。先测定背景参数,按照背景曝光设置相机,再调低闪光灯功率,让画面柔和融合。AI 复刻出了这种平衡技法带来的柔和渐变画面,却同时叠加了强度极高的闪光,二者无法共存。AI 照搬了技法呈现出的画面结果,却不懂这套技法背后的原理。
Midjourney 在模仿摄影师的成品,却不懂摄影师的操作逻辑。这份认知缺失,就化作现实中不可能存在的光照效果流露出来。
无主阴影
这个破绽更加隐蔽,但一旦看懂就再也无法忽略了。

T 恤肩膀与胸口位置有一片阴影。这片阴影说明,侧边应当有墙体或者物体遮挡阳光。可如果真的存在遮挡物,位置更高、处于同一平面的脸部理应也被阴影覆盖。但脸部却是完全受光的状态。
阴影在发际线处戛然而止,边界利落,却找不到投射阴影的实体。就算强行脑补出一处凸起结构来解释阴影,从摄影构图角度也说不通:这片阴影既没有分割画面,也没有烘托氛围,起不到任何构图作用。它的出现,既违背物理,也违背创作逻辑。
这背后的成因是,人物主体光照、环境光照是 AI 分别生成的,两套光照互不匹配。真实照片中太阳是统一光源,人脸、物体阴影全部受同一套光线约束,无需摄影师额外调整。AI 没有统一的“光线”概念,它分别学习了“明亮人脸”“布料上的阴影”两种图像样本,强行把效果拼接在一起,无视物理规则要求二者必须自洽。这就造成人物和背景仿佛是两张照片粘贴合成。
现实场景是,同一套光源照亮全部画面。如果一张图出现两套互相冲突的光照逻辑,本质就是两张图的拼接。
扁平化虚化背景
这是辨识度最高,却最容易被大众忽略的破绽。因为背景虚化,在大众认知里等同于专业摄影。

手机自拍有两个特征:广角镜头带来畸变,景深很大,几乎全部景物都清晰。而这张图全都不满足。它拥有大底相机人像的虚化背景,构图却是手臂伸直的自拍视角。现实中不存在可以同时实现二者的拍摄器材。
仔细观察虚化本身,破绽更加明显。光学虚化有一条规律:虚化程度随距离递增。距离一米的物体,虚化程度弱于距离五米的物体。但这张图里,砖块、灯具、窗帘虚化程度完全一致,仿佛全部背景物体都处在同一个距离。这是二维平面式的假虚化,就像在 PS 里把整张图模糊之后,贴到人物身后。
这并非偶然。AI 训练数据集包含大量后期合成素材:抠好的人物图层,叠加模糊的二维背景。AI 学会了这种取巧的模式,并且不断复现。如果图片背景虚化没有远近梯度,说明 AI 调用的正是训练集里这类劣质合成样本。

示例图片:大光圈下,虚化程度随距离逐渐增强。图片来源:Sasun Bughdaryan,Unsplash
再看人物佩戴的眼镜,隐藏着另一处漏洞——缺少鼻托。镜框上用来架在鼻梁两侧的细小构件直接消失。镜片和镜框看着逼真,但 AI 没有理解眼镜佩戴的机械结构,于是省略鼻托、铰链、镜腿这些实现佩戴功能的细小零件。

眼镜没有鼻托。
真实的焦外虚化存在于景深层次;虚假虚化只是一张布景背景。再留意细节:镜片完全没有反光,如同空镜框道具。下一个案例同样会出现该问题。

示例图片:优化反光与景深效果之后的 AI 图像
没有镜片的眼镜只是道具
这不只是单张图片的偶然失误,模型会反复出现同类错误,第二张案例可以佐证。


镜片局部缺损,虹膜也出现轻微变形。

示例图片:优化反光、眼部细节后的 AI 图像
光学镜片具备两个特性:折射,隔着镜片,脸部边缘轮廓会发生偏移;反射,会捕捉场景内光源。案例图片中的镜片,要么完全没有合理反光,要么出现银色高光,却找不到画面里对应的光源,属于凭空捏造的反光。当反光会增加画面复杂度时,AI 就直接省略;需要的时候就凭空编造。两种情况都会暴露 AI 痕迹。
还有一处机械结构缺陷,和上一张图的问题同源。顺着镜框往耳朵方向观察镜腿,镜腿中途片段消失,又突兀出现,明明处在深色头发前面,本该清晰看见,却凭空“消失”。AI 只画出一眼就能识别出眼镜轮廓,却忽略了支撑眼镜的结构。
两张不同的图片,犯了同一个错误:只复刻物体的外表,却忽略物体的功能。眼镜没有反光、没有鼻梁支架、镜腿残缺不全,这已经不是真正的眼镜,只是 AI 脑海中的眼镜概念的绘画。严肃人物佩戴这种道具感眼镜,画面会产生怪异违和感,观看者能感知到不对劲,却说不清缘由。
画面放置一个物体,就必须遵守它自身的物理规则。做不到,就不要加入画面。
想要写出真正拟真的提示词,先要掌握一套简单判断法则:ISLP。我们在文末展开细说。

Midjourney生成的一些图片
结语
我们见过海量真实照片,练就了辨别真实画面的眼睛。所以图片明明很美,你却感觉虚假,这不是莫名其妙的直觉,而是大脑捕捉到了画面缺失的因果逻辑。画面再好看,可观感失真,就应当舍弃。
虽然本文分析对象是 Midjourney,但不要认为其他模型就不会出现问题。这不是某一款工具的缺陷,而是所有图像大模型的共性。Nano Banana、GPT Image、Reve,全部只学习相关性,无法理解因果。出错细节各有不同,但底层问题不变。ISLP 法则适用于全部 AI 绘图工具。
不需要只依靠直觉辨别,可以按照下面的顺序逐项核查,记住四个字母 ISLP。
I‑Iris 虹膜:形态圆润无扭曲。解读眼球反光,反光照出的光源,要和整体画面光照匹配,矛盾则图片造假。
S‑Skin 皮肤:具备真实毛孔质感,不能过度平滑,雀斑也不能像模板印刷一样整齐排布。
L‑Light&Shadow 光影:光影逻辑自洽。整张画面统一光源,不存在没有投射源的孤立阴影。
P‑Physics 物理规则:物理逻辑成立。虚化随距离渐变,拒绝二维布景式模糊;眼镜要有镜片、鼻梁支架、完整镜腿;拍摄器材、构图视角要可以在现实中实现。
要想在生成图片之前就规避失败,有一个实用技巧:提示词写明成因,不要只写效果。不要只写“氛围感强光”,要写明光源本身。例如“iPhone 闪光灯,广角镜头”或者“单反相机,机顶正面闪光灯,50 毫米镜头”。AI 依旧理解不了物理原理,但这类关键词会调取海量真实参考图;把 AI 限定在具体设备之下,减少它凭空生成违背现实画面的空间。这不能彻底根除错误,但可以约束 AI。即便如此,生成之后依旧要用 ISLP 法则复核,就算提示词写清光源,模型依旧会出错。
编写提示词,本质就是约束 AI,让它生成的画面尽可能贴近我们真实想要的效果。
如果只是发布社交平台,没人细究,这些问题无关紧要。但在专业出版领域,修图师和摄影师会耗费大量时间打磨毛孔质感、优化眼球高光,赋予画面生命力。这不是多余修饰,而属于专业工艺。一张图片只能短暂博眼球,和能够牢牢抓住视线,差距恰恰就在于那些你不能交给 AI 随机生成的现实因果细节。
译者:Teresa