惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Microsoft Security Blog
Microsoft Security Blog
WordPress大学
WordPress大学
S
SegmentFault 最新的问题
爱范儿
爱范儿
B
Blog RSS Feed
Last Week in AI
Last Week in AI
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Blog — PlanetScale
Blog — PlanetScale
Vercel News
Vercel News
Jina AI
Jina AI
aimingoo的专栏
aimingoo的专栏
I
Intezer
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Attack and Defense Labs
Attack and Defense Labs
The GitHub Blog
The GitHub Blog
小众软件
小众软件
AI
AI
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
N
News and Events Feed by Topic
腾讯CDC
D
Docker
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
罗磊的独立博客
人人都是产品经理
人人都是产品经理
W
WeLiveSecurity
N
News and Events Feed by Topic
Security Archives - TechRepublic
Security Archives - TechRepublic
C
Check Point Blog
Webroot Blog
Webroot Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
H
Help Net Security
Recorded Future
Recorded Future
H
Hacker News: Front Page
T
Troy Hunt's Blog
V
V2EX
Forbes - Security
Forbes - Security
Stack Overflow Blog
Stack Overflow Blog
The Register - Security
The Register - Security
P
Palo Alto Networks Blog
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
博客园 - 叶小钗
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
S
Security Affairs
The Hacker News
The Hacker News
Simon Willison's Weblog
Simon Willison's Weblog
博客园 - 三生石上(FineUI控件)
B
Blog
Apple Machine Learning Research
Apple Machine Learning Research
C
Cyber Attacks, Cyber Crime and Cyber Security
D
DataBreaches.Net

OpenAI

Codex 多了个宠物功能,大家都有做啥有意思的宠物 只有我这么感觉吗? codex 5.5 比 cc 4.7 速度慢了 7-10 倍。。 求助: chatGPT 网络配置问题 切换 ChatGPT 从美区到土耳其有无风险? 大家现在都是用什么办法订阅 gpt pro 的? 准备买正价的 openapi pro 5x, apple 美国店 准备 100 刀的礼品卡 够不够? 或者 120 刀? Codex 5x 5 小时额度大概能用多少 Token 呢?想对比一下中转站和官方订阅 Codex 每个会话里的 Context 满了,自动压缩总是过不去 你们 Codex 弹电话验证了吗 我最近發現 chatgpt 可以綁 apple 年付的,我也是才知道 5.5 codex 模型是不是更耗流量了...... Codex 登录需要验证手机号了 chatgpt 代充这是常规操作 还是我被坑了 GPT pro 模型(5x plan)一周大约可以用几次? 哪个国家 appstore 订阅 openai pro 5x 价格最低? plus 怎么感觉越来越不经蹬了 强如 Codex GPT 5.5 竟也会犯如此低级错误 纯免费 GPT-Image-2 AI 生图服务:限时 无需任何登录 在不考虑封号风险的情况下, GPT-5.5 vs Opus 4.7 使用体验上哪个更好? chatgpt 充值求助 现在有什么稳定订阅 Chatgpt 的方法吗 慢讯 Free 计划用户继可以用 image-2 后,今天开始可以在 codex 内调用 GPT-5.5 Codex (APP) 保姆级全攻略,海量实战教程, 一文精通 关于 xiaomi MiMo Token Plan 的套路我一一说下 Codex 额度锁死 100%,这正常吗? 我做了一个 AI 电商生图工具: 13 场景预设 + 数据全在浏览器(1 毛 6 一张) Codex 最近的更新速度搭上火箭了吗? 有没有靠谱的 GPT Pro 代充站 我的 GPT 是猫,你呢 😄 Codex 额度又重置了 ? 有没有类似 ChatGPT 这种 Agent 能力的 API 现在还有什么 gpt 账号 plus 的渠道吗?号商别再内斗了 chatgpt 充值 5x pro 前已经订阅了 plus,那 plus 的 20 刀就没了吗 免费领取 plus/team codex 使用 5.4 以上版本模型压缩上下文总失败? 各位大佬,有没有注册机可以用的,有偿 请问,调用 gpt-image-2 通过 api 的方式使用,请问用什么 app 呢? 试用的路子是也没了吗 Chatgpt 5.5 发布了 天下苦 Claude 久矣, GPT 就出招了, 5.5 目测下限是 opus 4.6 GPT 5.5 发布了 openai 发布了 gpt5.5 想要多人拼车开 gpt pro 100 刀 GPT Image2 有需求玩一下,现在怎么开 PLUS 最稳 GPT Image 2 太惊艳了,随手试了几张图 注册机 OpenAI 警告邮件: Cyber Abuse 为啥感觉 gpt 比国产模型便宜多了,是错觉吗? Copilot 用不了?突然不能用了,各位有这个问题吗 - V2EX windows 的 codex 有非商店版的么? gpt-image-2 太顶了 codex 开始灰度 GPT 5.5 了 gpt-image-2 生图确实很顶啊,附带几张生成效果。 GPT Image2 杀死 app screenshots 赛道 求怎么开 plus 啊,我的要到期了,天才程序员要陨落了 - V2EX GPT Image 2 上线了! - V2EX 额度削减后的 Plus Codex 大概是周限额 100 刀 Token 的样子 OpenAI Platform 的支付方式,只支持信用卡/借记卡支付吗? 港卡扣账卡原来不能开 gptplus 关于“AI 思考”长度 靠谱的 chatgpt plus 会员途径 ChatGPT 竟然敢阴阳怪气的:「洗你人,不洗车。」你们的这货也是这么贱贱的吗 OCBC 充值 OpenAI API Codex 周额度又刷新了,省着用的血亏 vibe coding 投毒真是一个大问题 在有完整模板的情况下, AI 生成 PPT 哪家强? 以防你不知道 Codex App 偷偷加了 SSH 远程开发功能 gpt 6.0 到底什么时候发布呀,各种新闻说明天发,怎么还没动静,隔壁 claude 都发布最新的了 deep research 生成的研究报告效果如何? 低价 GPT 到底有多少漏洞,怎么封了还有 偷偷篡改 function call 的数据,居然被 AI 察觉了😮 各大 AI 平台网页版和 api 质量有差异吗? 你的 plus 还好吗? [吃瓜] 有人在 Openai 论坛举报了谷歌英国 Plus 专业版计划被广泛滥用,但是并没有给出可复现的技术细节 现在到底是什么模型强?性价比高? 低价 GPT 订阅漏洞已被捅到官方脸上 这波 GPT Codex 曝光后续的操作过于逆天 gpt-image-2 和 nano-banana-2 对比 从 X 上搬运来的白嫖 GPT Plus 教程 OpenAI GPT-IMAGE-2 提示词合集 App → CLI → App ? openrouter 使用国外模型 分享下最近低价 GPT Codex 的来源(源头) OpenAI 发布 Codex 重大更新:支持自动操作电脑与长期任务自动化 同一个 appleid 可以给不同 chatGPT 账号订阅 plus 吗? 某鱼上 codex 的价格这么便宜是否有猫腻? (真实性待验证)关于低价 GPT 账号怎么来的 目前付费订阅 chatgpt Plus 的最佳方式是什么? Chatgpt Pro 用量用不完的可以开这些设置 ChatGPT Pro 5x 套餐 量真的很足! Codex 里的 GPT5.4 也能降智?上午让它改两个问题,改了一个小时了, plus 额度用了一半了还是没改好,和前几天用的体感完全不一样。要它改的问题也不复杂。服了。 opencode 消息周知插件 OpenAI Plus 和 Team 都缩水了吗 讯飞星辰的 Coding Plan 如何? 火山云的 Coding Plan 值得买吗? Doubao-Seed-2.0-Code、Doubao-Seed-2.0-pro 这 2 个模型怎么样? - V2EX GPT-6 准备发牌了!聊聊最近折腾 Hermes-Agent 的一点心得 今日份 GPT 5.4 笑话 刚升级到 Pro 100 美金订阅,怎么还不如原先的 Plus20 耐用了 Anthropic 出了三种 Agent 架构, SDK / Teams / Managed,大家在用哪种? 昨天刚充了 10 刀 API 余额,今天就被封号了 - V2EX
qwen3.6 27b 本地编码测试
zsj1029 · 2026-04-27 · via OpenAI

这是一个创建于 47 天前的主题,其中的信息可能已经有所发展或是发生改变。

搞了一上午,本地 a100 40g ,输出也慢 40t/s
大概的提示词劳力士风格,罗马数字,月相日历,高贵典雅

月相那块搞了好多轮

结论:
小参数的模型智力不差,Trae IDE agent 连接本地模型,coding 完全可用

  • 模型
  • 本地
  • 编码

    62 条回复    2026-05-02 20:36:52 +08:00

    zsj1029

    1

    zsj1029      4 月 27 日


    是有动画效果的,星星会明暗,上下左右还有钻石闪烁效果,不太明显
    日期,月相跟着时间会变

    zsj1029

    3

    zsj1029      4 月 27 日

    @Seanfuck 目前 128 ,256 也试过,llamacpp 的后端,开始都是快的,多轮会话,kv-cache 累计推理感觉就慢了

    Orangeee

    4

    Orangeee      4 月 27 日

    看着效果还凑合,一般任务应该够用

    pedclub

    5

    pedclub      4 月 27 日

    ![qwen 3.5]( https://img.cdn1.vip/i/69ef0fc713d8b_1777274823.webp)
    ![qwen 3.6]( https://img.cdn1.vip/i/69ef0fca7692e_1777274826.webp)
    3.6 进步挺大的

    sentinelK

    6

    sentinelK      4 月 27 日   ❤️ 1

    qwen3.6 35B A3B 的跑分还是挺好看的,智力和满血 DeepseekV3.2 不相上下,但 Agent 能力比 DeepseekV3.2 强很多。和我在 hermes agent 上的体感一致。

    从这个角度看,最近这一年,localLLM 的进步,比大模型大很多。
    我用家里的 8GVRAM ,64GBRAM 的老爷机用 llama.cpp 跑了一下 Q4 量化,驱动 hermes agent 的普通业务没什么问题,就是有点慢。在--on fit 配置下,大概是 20 多 token 每秒。

    等 M5 MAX 的 mac studio 上线,我也打算买一台。

    sentinelK

    7

    sentinelK      4 月 27 日

    主要是 localLLM 强大之后,Agent 玩法才真正的被盘活。
    隐私/便利的鱼熊悖论也就被打破了。

    wumoumou

    9

    wumoumou      4 月 27 日

    好厉害,能不能做成 API 卖钱

    mgsv2047

    10

    mgsv2047      4 月 27 日

    为啥我用 windows 的 lm studio 跑这个模型,又慢又蠢? 4090D + 32g 内存

    zsj1029

    11

    zsj1029      4 月 27 日

    @mgsv2047 我这是公司的 a100 ,设备不行吧,还得是专业卡,35b 的那个专家模型,能跑 120t/s

    evan1

    12

    evan1      4 月 27 日

    a100……门槛还是太高了。

    zsj1029

    13

    zsj1029      4 月 27 日

    @evan1 我不知道啊,80g 的,咸鱼问的 5w 不到,2 块 5090 ?算力翻倍至少吧

    furlxy

    14

    furlxy      4 月 27 日

    为啥都在用钟表、天气来测试?

    zsj1029

    15

    zsj1029      4 月 27 日

    @furlxy 因为那个二叉树,很简单就过了,这个至少有点工作场景,写后端更没问题,比前端还快,毕竟不用调样式

    darrh00

    16

    darrh00      4 月 27 日

    vscode 上有没有好用的连接本地模型的插件?

    zsj1029

    18

    zsj1029      4 月 27 日 via iPhone

    @sentinelK mac 速度也慢,只能能加载大模型,显存带宽制约的,a100 。1.8t ,mac 只有 700g 好像

    zsj1029

    21

    zsj1029      4 月 27 日

    @sentinelK 就是 llamacpp 跑的,fiton ,显存不够,cpu 卸载,a100 可以全部加载到显卡的,不需要,其次开启 q4 kv-cache 量化后,能跑更多并发,更省显存

    kenpuluma

    22

    kenpuluma      4 月 27 日

    这个不算小模型了吧,活跃参数量比 qwen3-235b 都大~

    zsj1029

    23

    zsj1029      4 月 27 日 via iPhone

    @kenpuluma 确实,表达的意思就是,开源本地模型发展超预期,本地搭建不再是玩具。评测赶上了 opus 4.5

    listenerri

    24

    listenerri      4 月 27 日 via Android

    @darrh00 #16 vscode 上用 unify chat provider 插件接自定义模型体验不错

    peyppicp

    25

    peyppicp      4 月 27 日

    Trae 是怎么链接本地 LLM 的?我看免费版都不能指定本地模型了

    stefwoo

    26

    stefwoo      4 月 27 日

    Qwen3.6 A35B-A3B 4bit 在我的 3090 下运行也飞快啊

    sentinelK

    29

    sentinelK      4 月 27 日

    @stefwoo 这回的 27B 每次执行都是 27B 满参数,所以比 35B A3B 运行速度更慢,但是智商评分更高。

    cskeleton

    30

    cskeleton      4 月 27 日

    @sentinelK #6 Gemma4 和 Qwen3.6 明显把本地模型的水平抬高了一档。另外 Qwen3.6 整个系列感觉进步明显。

    xiaomushen

    31

    xiaomushen      4 月 27 日

    qwen3.6 大模型是拉了,没想到小模型这个给力。

    zsj1029

    34

    zsj1029      4 月 27 日

    @peyppicp 搜一下,配置里面找到模型,类型 openai ,然后自定义模型就可以配置本地了,窗口操作,不需要什么 config 文件

    jerseyhero

    36

    jerseyhero      4 月 27 日

    佬,试试 Gemma4 26B-A4B 效果如何呢

    zsj1029

    37

    zsj1029      4 月 27 日   ❤️ 1

    @jerseyhero 早些试过,工具调用标签自成一派,神经病一样,agent 兼容不了,后面发布 qwen3.6 27b ,看模型评测,完全吊打,不想碰了

    zcf2009

    38

    zcf2009      4 月 27 日

    这个可以直接文生图?

    germain

    40

    germain      4 月 27 日 via iPhone   ❤️ 1

    @jerseyhero 很拉,本地炼丹最强的就是 qwen 几个中小模型了,DeepSeek 3.2 API 也不错,白菜价炼丹。

    zsj1029

    42

    zsj1029      4 月 27 日

    @germain 真的,现在的小模型不是玩具,花了两晚上,把 vue 的前端项目,40+的页面,用 svelte ,qwen3.6 完美重构

    germain

    44

    germain      4 月 27 日

    @zsj1029 一年前这种根本不敢想(太拉跨),现在已经是现实了。这种感觉就好像我这里标准泳池每年开池全部换新水不心疼,因为自来水不要钱一样😂

    goodryb

    47

    goodryb      4 月 28 日

    在 mac 上也跑过这个模型 Q4K_M 量化版,用 qwen CLI 搞个赛车游戏 ,速度比较慢,但是结果还是可以的,需求的理解基本上没有偏差

    zsj1029

    48

    zsj1029      4 月 28 日

    @goodryb 嗯我跑的也是量化,模型加 kv-cache 双量化,不然显存吃不住,输出也慢

    simo

    49

    simo      4 月 28 日

    前几天试过,效果挺好的,32G m4 mini ,35B 量化版,50t/s

    这几天在考虑 搞个 AI Max 385 主机试试,不到 2w ,看带宽有点低,不知道效果如何。专门跑本地模型用

    zsj1029

    50

    zsj1029      4 月 28 日

    @simo 带宽一定要高,2t 的话,130t/s 按比例换算就好了

    midraos

    51

    midraos      4 月 28 日

    @zsj1029 #11 应该没优化参数吧,我在 5080 上跑 35b-a3b 这个,显存只够加载一部分层,速度有 40t/s

    superhack

    52

    superhack      4 月 28 日

    5090 27B ,vllm 峰值 120 tok/s, 平均 85 tok/s 上下

    Hermitist

    54

    Hermitist      4 月 29 日

    楼上各位有没有兴趣基于 vibe coding 帮我开发点程序? 主要是小型的进销存/单证/CRM 系统? 有意者可以加我 ID 微信, 也算可以给你们回点血.

    superhack

    55

    superhack      4 月 29 日

    @zsj1029

    ```
    services:
    vllm-qwen36-27b:
    image: vllm/vllm-openai:v0.20.0
    container_name: vllm-qwen36-27b
    restart: "unless-stopped"
    ports:
    - "8085:8000"
    volumes:
    - models/huggingface/qwen3.6-27b-autoround-int4:/model
    environment:
    - CUDA_VISIBLE_DEVICES=0
    - VLLM_WORKER_MULTIPROC_METHOD=spawn
    - PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
    shm_size: "16gb"
    deploy:
    resources:
    reservations:
    devices:
    - driver: nvidia
    count: all
    capabilities: [gpu]
    command:
    - --model
    - /model
    - --served-model-name
    - qwen3.6-27b
    - --quantization
    - auto-round
    - --dtype
    - float16
    - --gpu-memory-utilization
    - "0.92"
    - --max-model-len
    - "160000"
    - --kv-cache-dtype
    - fp8_e5m2
    - --max-num-seqs
    - "1"
    - --trust-remote-code
    - --reasoning-parser
    - qwen3
    - --enable-auto-tool-choice
    - --tool-call-parser
    - qwen3_xml
    - --enable-prefix-caching
    - --speculative-config
    - '{"method":"mtp","num_speculative_tokens":2}'
    - --host
    - "0.0.0.0"
    - --port
    - "8000"
    ```

    nasmatic

    58

    nasmatic      4 月 30 日

    我拿了两张 H20 141G 跑这个,是不是有点奢侈了😂

    nasmatic

    60

    nasmatic      4 月 30 日

    我尝试了上面哥们发的投机推理的配置,py3.13 ,直接报错,又回退了,好像是两张卡通信有 bug ,互相询问不到对方剩的 vram

    zsj1029

    61

    zsj1029      5 月 2 日

    @nasmatic 刚试了可以的,速度提升三倍了,多卡不知道是不是需要 nvlink ,我是单卡没问题的

    zsj1029

    62

    zsj1029      5 月 2 日

    vllm serve \
    /models/qwen3.6-27b-int4-autoround \
    --max-model-len 131072 \
    --kv-cache-dtype fp8_e5m2 \
    --reasoning-parser qwen3 \
    --max-num-seqs 3 \
    --served-model-name Qwen3.6-35B-A3B-UD-Q4_K_M.gguf \
    --quantization auto-round \
    --enable-auto-tool-choice \
    --max-num-batched-tokens 8192 \
    --tool-call-parser qwen3_xml \
    --enable-prefix-caching \
    --trust-remote-code \
    --speculative-config '{"method":"mtp","num_speculative_tokens":2}' \
    --tool-call-parser qwen3_coder \
    --gpu-memory-utilization 0.88 \
    --dtype half \
    --host 0.0.0.0 \
    --port 8011