跳到正文
原文
Hugging Face Blog·· 1 天前精选AI 评分71

如何用 ML Intern 在 HuggingChat 里做出原本不存在的模型

The model that didn't exist, so you made it yourself

AI 导读

作者在 HuggingChat 开启 ML Intern 后,用提示词驱动智能体训练并公开六个原本没有的小模型,算力花费合计约 USD 103。开篇的 Pocket Rewriter 把 Qwen-Image 2.1 所带 9B 提示词改写模型做成可在 CPU 运行的 0.8B 学生模型,有效输出占 99.7%,token 约为教师模型的四分之一,项目花费 USD 16。

推荐理由

作者把基线评测、冒烟测试和花费上限写进提示词,用约103美元在数天内训出六个可公开复用的小模型。

正文 · AI 翻译

上周,我想要一个随 Qwen-Image 2.1 附带的 提示词改写器 的小型版本。官方版本是一个 9B 模型,大约需要 20 GB 内存,并且在写出一个段落之前会思考数千个 token。在 Hub 上,我只找到了同一个 9B 模型的压缩副本。于是我向 ML Intern 描述了我想要的东西,第二天就得到了一个可在 CPU 上运行的 0.8B 版本。它有 99.7% 的时候返回有效输出,并且大约只用教师模型四分之一的 token。整个项目的计算费用,包括让 9B 模型标注 8,797 条示例请求,共计 USD 16。

在接下来的几天里,我用同样的方式又做了五个模型。每一个都始于 HuggingChat 中开启 ML-intern 后的一条消息,最终都成为 Hub 上的公开模型,评估结果写在模型卡中。ML-intern 会规划工作,在花费任何费用之前向我询问预算,在正式任务之前先运行一个小测试,然后在 Hugging Face 硬件上训练、评估并发布。

我如何向 ML Intern 写提示词

第一条消息是我投入精力的地方。我为下文分享的 citrus 模型写的第一条提示大约有 450 个词。到第 6 个项目时,它更接近 2,000 词,因为每个项目都教会我一些想用在下一个项目里的东西。全部七条提示都在 GitHub 的 yvrjsharma/ml-intern-prompts 上,与我写的完全一致。

一条提示以一行想法以及我想要它的原因开头。然后它点明具体部分:数据集、基座模型、训练脚本。我已经核对过的内容会放在一个标题下,标题原文就是“Verified facts, do not re-derive”,这样智能体就会把预算花在工作上,而不是重新发现我已知的内容。对于相机角度 LoRA,那一节列出了哪个训练器刚刚加入了透明图像支持,以及哪些未解决的 GitHub issue 让备用训练器存在风险。

提示中有两行至关重要。第一行要求在任何训练之前先给出基线。例如,citrus 提示写道:“同时报告基座模型在训练前于同一指标上的零样本得分,以便我们看到提升。”没有它,你只会得到一个训练好的模型,却不知道它是否比一开始更好。第二行是附带检查的冒烟测试。对于图像 LoRA,我要求先训练 50 步,然后检查保存的权重确实发生了变化,再为完整运行付费。

在提示末尾,我列出预期交付物并限制成本。我定义模型卡中应包含的内容,并加入一条类似这样的指令:“将总支出上限设为 USD 12,超出之前先问我。”因为 ML-intern 开始每项任务时预算为零美元,并且在执行付费任务之前需要许可,这一支出上限会被严格执行。如果你不给出预算,智能体会根据项目规模建议几条路径,并询问你更偏好哪一条。

你第一次尝试时不一定需要所有这些。例如,我的 citrus 简报中没有 verified-facts 部分,ML Intern 仍然做出了一个 将准确率提升至三倍以上 的模型,对比对象是 Qwen3.5-2B 模型。让我带你看看短短几天内我用 Ml-Intern 做的 6 件事。

1. 一个了解你所在领域的模型

通用视觉模型可以描述一片发黄的柑橘叶。然而,要告诉你这是螨虫问题还是缺镁,以及治疗该植物的生物与非生物方法,则非常困难。我使用 Claude,整理出一份训练数据集,合并了 Hub 上由 Project-AgML 组织托管的三个来源。由此得到的 citrus-disease-vlm-instruct 是一个包含 3,017 张标注图像的数据集,涵盖 21 种不同的害虫、疾病、营养缺乏和治疗方法。ML-intern 使用这些样本对 Qwen3.5-2B 进行了微调,并确保事先对基础模型做了基准测试。

在 335 张测试照片上,基础模型有 14.9% 的时候指出了正确问题。在一块 A10G 上经过两个 epoch 后,微调模型达到了 52.8%。计算成本约为 USD 1.90。

查看:模型 · 数据集 · Citrus Doctor App

2. 一个能画出你的角色的模型

图像模型认识很多角色。以 Hugging Face 品牌素材的扁平风格绘制的 Huggy 并不在其中。我让 ML-Intern 在 FLUX.2 klein base 4B 上训练一个 LoRA,训练数据来自 Chunte/huggy_for_training 数据集中的 84 张带说明的画作。

该智能体每 100 步保存一个检查点,并用每个检查点绘制同一组提示词,因此很容易挑选。第 200 步是 Huggy 第一次完全符合角色设定的时候。从第 500 步起,Huggy 的风格开始渗入与 Huggy 无关的提示词!训练好的 LoRA 在蒸馏版 klein 模型上以 4 步也能工作。计算成本约为 USD 7.60。

查看:模型 · 数据集 · Huggy Generator App

3. 一个会新招式的模型

  1. 相机角度 LoRA 是早期 Qwen-Image 模型中最受社区喜爱的附加组件之一。你可以给模型一张物体图片,并要求从左侧 45 度查看它。在 Qwen-Image 2.1 模型发布几天后我查看时,还没有人做过,于是我让 ML-intern 来构建它。

Qwen camera angle LoRA

ML-intern 将来自 Google Scanned Objects 的 1,030 个扫描家居物品各渲染成 24 个角度,共 24,722 张透明图像,这项 CPU 任务只花了几美分。随后它确定了 461 个物体用于训练、40 个留作测试,以及 1,844 对前后对照的训练样本,均匀分布在 23 条相机指令上。

训练在一块 A100 上运行了 2,000 步,约 90 分钟(约 USD 3.75)。整个项目大约花了半天和 48 个作业,其中包括因缺少软件包或路径错误而失败、必须由 ML-Intern 重新提交的作业。总计算成本约为 USD 16。

查看:模型 · 数据集 · Viewpoint Orbit App

  1. Doodle-in LoRA 是另一个很酷的想法。上传一张带有洋红色涂鸦的照片,并加上一条点名某个物体的简短提示词。该 LoRA 会用该物体替换涂鸦,同时保持原有的光照和构图一致。

此前并不存在这样的数据集,因此我的提示描述了如何制作一个。从 Open Images 中的一张真实照片开始,用 LaMa 修复模型移除一个物体,并在该物体原来所在的位置画上涂鸦。未经改动的照片即为目标。ML-intern 在 CPU 沙箱中编写并测试了配对构建脚本,随后将它们作为 GPU 作业运行,并在此过程中记录每张源照片的作者与许可协议。它构建了 6,042 个训练对以及一个 160 对的测试集,其中 40 个测试对来自完全排除在训练之外的 23 个物体类别。

训练之前,它分别测量了基础模型本身以及搭配 Viggle turbo LoRA 时的表现,并确认批量运行编辑会生成完全相同的图像,从而使评估成本更低。训练在一块 A100 上运行了 2,000 步,耗时 1 小时 38 分钟(约 USD 4),而对 48 个测试对上已保存检查点的比较选出了第 500 步。

与 Viggle turbo LoRA 搭配、采用 6 步时,该 LoRA 表现非常好。在被绘制的位置检测到的物体占 67.5%,每次编辑耗时 4.7 秒。来自 23 个未见类别的物体与其余物体一样可靠地落位(65.0% 对 64.2%)。该项目耗时一天多一点,共 59 个作业。总计算成本约 USD 24。

查看:模型 · 数据集 · Doodle-in App

4. 一个适合你设备的模型

  1. 本文顶部的 Pocket Rewriter 是第一个。ML-intern 首先通过 Inference Providers,用一个小型指令模型生成了 8,797 条简短图像请求,遵循我在提示中设定的混合构成:照片、海报、标志、信息图等,其中约三分之一要求引号内的精确文字,且许多使用英语以外的语言。随后 9B 教师模型在一块 A100 上用 2 小时 37 分钟重写了全部内容(约 USD 6.50)。经过质量筛选后,选出 1,840 个样本作为训练数据集。

Qwen Image 2.1 Pocket Studio

在一块 A10G 上训练 0.8B 和 2B 学生模型分别耗时 12 分钟和 18 分钟(两者合计 USD 0.75)。0.8B 还以 812 MB 的 GGUF 文件形式提供,可在 CPU 上运行。该项目耗时约 11 小时,共 24 个作业。总计算成本约 USD 16。

查看:Pocket rewriter 0.8B Student · 2B Student · 数据集 · Pocket Studio App · 在 Rewriter Arena 中比较师生模型

  1. Agate-Preview-002-4step 是第二个。Logolabs 的 Agate Preview 002 是一个 260M 参数的文生图模型,小到可以在浏览器中运行,但它需要带引导的 50 步,即每张图像要进行 100 次网络前向传播。我让 ML-intern 把它蒸馏到只需 4 次前向传播!

一共进行了两轮。第一轮将 155,000 张训练图像缓存为潜变量,把引导烘焙进模型,然后分阶段把步数从 16 降到 8 再降到 4,全部在 A100 上完成。4 步学生模型在同样的 4 步设置下,于 GenEval 和 FID 上超过了教师模型,之后 ML-intern 将其导出为供浏览器使用的 ONNX。这一轮耗时约 13 小时,花费 USD 22。

我进行了第二轮训练,让 ML-Intern 再把 4 步学生模型改进一些。它随后用教师模型在 16 步下又生成了 24,000 个图像对,并针对这些图像对微调 4 步学生模型约一小时。GenEval 从 0.509 提升到 0.536,而教师模型在 50 步时为 0.563,学生模型仅用 4 步(计算量为其四分之一)。ML-intern 重新导出了浏览器版本。第二轮耗时约 8 小时。两轮合计计算成本约 USD 37。

查看:Agate 4-step 模型 · 数据集 · 在浏览器中运行 Agate · Agate 4-step LIVE

花费多少

模型 基础模型 算力
Citrus Doctor Qwen3.5-2B USD 1.90
Huggy LoRA FLUX.2 klein base 4B USD 7.60
Pocket rewriter(0.8B 和 2B) Qwen3.5-0.8B 和 2B USD 16.05
Viewpoint Orbit LoRA Qwen-Image 2.1 USD 16
Doodle-in LoRA Qwen-Image 2.1 USD 24.30
Agate 4-step(两次运行) Agate Preview 002 USD 37
合计 约 USD 103

这些是每次会话报告的 GPU 和 CPU 任务费用。

做出你的

ML-intern 就在 HuggingChat 里。开启 ML-intern 模式并粘贴一条提示词。如果想要一个起点,我的示例提示词可以免费复制。从一个你希望存在的模型,以及你手头已有、或能够描述的数据集开始。给它一个小预算,要求给出基线和冒烟测试,在提高上限之前先读一读返回的结果。

如果你用它做出了东西,请在 X 上分享,并标记 @Gradio 和 @HuggingFace。我们很想看到你做出的、别人不会想到专门为你打造的模型。

来源:Hugging Face Blog · huggingface.co