修片、质检、设计自动化。凡是眼睛干的活,菌丝都能跑。
一个模型解决不了所有视觉任务。视觉模型负责"看懂图里有什么问题",提示词 SLM 负责"把问题翻译成修图工艺"。两个模型各司其职、互不替代。
从原片中读出光源、色温、曝光、皮肤瑕疵、构图问题,输出结构化描述。它是眼睛,不动手。
把"原片的问题 + 客户的工艺标准"翻译成可执行的修图 prompt、mask 区域、强度参数。它是修片师大脑。
听 SLM 的 prompt,对原图做像素级修改。保留身份、修调色调、磨皮、调光,一气呵成。它是手。
原片全程不出店。断网 7 天仍可工作。修片日志完整留痕。视觉模型 + SLM + 编辑器都跑在客户自己的边缘盒子上。
每张原片跑完这 4 步,10-15 秒出成片。人工只兜底最后 10%。
读取客户历史成片 30-100 张,建档"这家店的味儿"。一次性建档,结果复用。
每张原片必跑。输出结构化问题清单:光源、色温、皮肤、构图。
本地小模型。读懂"海绵蛋""高低频磨皮""双曲线"等修片黑话,输出可执行指令。
Qwen-Image-Edit / 本地编辑器。按 SLM 指令修图,保留客户身份,调整色调与质感。
凡是眼睛干的活,菌丝都能跑。下面是已经验证或正在验证的 4 类场景。
婚纱、写真、儿童摄影。每店独立 LoRA,旺季 24 小时交付,原片不出店。
3C 电池、汽车零部件、注塑件表面缺陷检测。视觉模型识别瑕疵,SLM 输出分级。
电商主图、详情页素材批量生成。视觉模型定风格,SLM 输出 prompt,文生图批量出图。
卫星图变化检测、遥感影像分类。视觉模型提取变化点,SLM 输出结构化描述供 GIS 入库。
一个大模型能看能写,但写不出"修片师要的语言"。双模型分工是物理决定的,不是工程选择。
视觉模型输出的是结构化描述(光源、色温、皮肤瑕疵),不是像素修改指令。让它直接修图,等于让眼科医生做手术。
"海绵蛋遮瑕""双曲线观察层""中性灰精修" — 这些是修片师的黑话。通用 LLM 听不懂,必须微调专用 SLM。
婚纱、政企、儿童摄影的原片都涉及客户隐私。视觉模型 + SLM + 编辑器全部本地部署,原片全程在客户机房里。
影楼 A 喜欢暖黄肤色 + 柔光 + 高饱和,影楼 B 喜欢冷白 + 戏剧光 + 低饱和。SLM 微调每店风格 LoRA,而不是一个通用模型。
不是 PPT,是真实环境跑出来的。
每张原片 90% 由 AI 完成,10% 人工兜底
单张修片成本从 ¥5-30 降到 ¥0.16-0.68
原片到成片 10-15 秒 GPU 推理
原片全程不出客户机房
双模型视觉生产力的接入路径清晰,3 步可见效果。
提供 50-100 张历史成片 + 50 张待修原片。我们用 SLM 跑盲测,3 天给出"这家店标准 vs AI 复现"对照报告。
一台 RTX 4090 边缘盒子,¥2-3 万。插电接网,原片不出店。30 天完成部署 + 培训。
客户满意度评分自动回流 → LoRA 持续微调。季节漂移、风格迁移,AI 自己学。
任何视觉生产力问题:影楼修片、工业质检、设计自动化、地理信息。
发邮件预约一次 30 分钟的可行性评估。