惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

A
About on SuperTechFans
G
Google Developers Blog
L
LangChain Blog
aimingoo的专栏
aimingoo的专栏
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
云风的 BLOG
云风的 BLOG
小众软件
小众软件
月光博客
月光博客
Recent Announcements
Recent Announcements
人人都是产品经理
人人都是产品经理
P
Proofpoint News Feed
博客园 - 聂微东
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
雷峰网
雷峰网
The Cloudflare Blog
博客园_首页
美团技术团队
大猫的无限游戏
大猫的无限游戏
B
Blog
IT之家
IT之家
Jina AI
Jina AI
H
Hackread – Cybersecurity News, Data Breaches, AI and More
C
Check Point Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知

机器学习

llama.cpp 服务开启 embedding 是否稳定? 深度学习的 LLM 就像受伤的大脑 大语言模型会被其他技术取代吗? llm 训练最 dirty work 的就是数据处理! 做机器学习强烈推荐看看 MIT 18.S096 矩阵微积分 求助微信聊天记录训练 ai 请问 AI 训练大佬 : 目前大家不写 blog, stackoverflow 等,如何训练新的优质数据,还是拿 AI 数据训练自己? 想要真正理解目前的深度学习(不仅是打杂的炼丹师),需要怎样的数学基础 怎样加快 onnx 模型在 cpu 上的推理速度啊 AI 公司瞄准的顺序是浏览器、输入法、操作系统 有什么能本地跑的机器学习项目吗? 求助 使用 ddddocr 自训练模型场景下,遇到了 onnxruntime.capi.onnxruntime_pybind11_state.InvalidArgument BERT 论文复现: 经验 & 教训 求推荐一些 LLM/深度学习方面打基础的书籍或者课程 2025 年底,如果想做一个图像分类模型,用什么模型来微调比较好 目前使用 yolov8 训练了一个目标检测模型,但是上线使用效果不是很好,怎么优化? 最近看 1-2 万主机发现 3090 还是能打的 想做有声小说声音克隆, 3060Ti 能扛得住吗? [AI Glimpse 科普系列] KV Cache 的原理推导与代码实现(基于 GPT2) 关于 OCR 以及以图找图识别 这类型的英语学习视频,是用哪个模型生成? 怎么实现提取俩个图片的一些特征,然后进行特征比对 检测画面中存在漏水,给点思路 学习 AI, 跑下模型, 应该用什么 N 卡? 有没有大佬了解机器学习的 mlops 框架或者平台 如何把本地文件作为大模型的知识库 使用大语言模型进行文本分类任务需要微调吗? lima 和 colima 居然是有关系的 [AI Glimpse 科普系列] 不到 100 行 Python 代码从零实现 LLM 的推测采样算法 什么?唠唠嗑就能生成游戏关卡! Unreal Engine + MCP 来了!
gpt4o 图像生成的技术讨论(自回归模型又好起来了?)
lthero · 2025-04-10 · via 机器学习

gpt4o 图像生成的特点是,生成时从上到下逐渐清晰化(并不只是显示技巧)

s1

如果使用 diffusion 进行生成,它的过程可能是这样的

s2

但已知的是 gpt4o 图像生成(似乎)已经转向 autoregressive(自回归模型)+transformer

s3

目前外网也对 gpt4o 的技术进行了猜测,但也没讨论出个结果来(大多是认同转向了 ar 模型)

自回归模型是要打败 diffusion ,并在多模态领域又好用起来了吗?

另外,目前开源界似乎还没有什么动静,国内的字节跳动在 ar 的图像生成领域探索得还挺多(发了不少 paper )