用 Gradio Workflow 将 AUTOMATIC1111 重建为 Workflow1111
Workflow1111 把 AUTOMATIC1111 的大部分功能重做成一张 Gradio 工作流画布,包含十一条媒体管线和七十三个节点。登录 Hugging Face 账号或提供访问令牌后,可运行文生图、高分辨率修复、图生图、提示词矩阵、VLM 反推、检测生成遮罩、标注、去背景、PNG Info 和图像转视频,模型调用使用用户自己的额度。
Workflow1111 把 AUTOMATIC1111 的大部分功能重做成一张 Gradio 工作流画布,包含十一条媒体管线和七十三个节点。登录 Hugging Face 账号或提供访问令牌后,可运行文生图、高分辨率修复、图生图、提示词矩阵、VLM 反推、检测生成遮罩、标注、去背景、PNG Info 和图像转视频,模型调用使用用户自己的额度。
作者用TRL与OpenEnv复现Surya Narreddi的思路,训练编码模型编写JavaScript,经p5.brush绘制水彩,并在Hugging Face公开参考池、RL环境、训练脚本和模型。
Google DeepMind 开放 Nano Banana 2 Lite 与 Gemini Omni Flash,分别用于高速图像生成,以及视频生成和对话式编辑。
推荐理由:官方同时给出图像模型的延迟与单价,以及视频模型的按秒定价和时长限制,读者可以据此估算图生视频迭代的成本。
Google Photos 的 Auto frame 现已加入拍后重设视角能力,用机器学习理解场景与空间布局,再用生成式 AI 从新机位生成照片。方法先估计三维点图、可见表面和原相机焦距,重点减少人体与面部重建伪影,再渲染调整后的相机位姿和焦距;新露出的区域由潜空间扩散模型补全,并以分类器引导和区域缩放保留原内容。
推荐理由:Google Photos 的 Auto frame 会把已拍照片当作三维场景并自动调整机位,同时补全新视角里原先不可见的内容从而改善人像与广角构图。
Mistral 更新 Le Chat,新增 Deep Research 预览、语音模式、基于 Magistral 的多语言推理、Projects,以及与 Black Forest Labs 合作的图像编辑。
推荐理由:Le Chat 把深度研究、语音、多语言推理、项目文件夹和图像编辑放进同一入口,便于对照现有检索与整理流程看哪些环节被接上。