Qwen 3.8 27B:消费级GPU本地运行逼近Opus4.6编程能力

Qwen 3.8 27B以密集视觉语言模型形态开源,在单张消费级GPU上实现接近Claude Opus 4.6的编程基准测试表现,但社区对其基准测试有效性与真正的本地AI突破之间存在严重分歧

Hacker News 1 · Reddit 11 · Zhihu 18 856 条已覆盖讨论 5 条来源证据

今日概览

Qwen 3.8 27B开源权重发布,支持本地部署于消费级GPU,在编程基准测试中超越Claude Opus 4.6 Max,但社区对基准测试过拟合问题存疑

DeepSeek-V4-Pro-0813被确认仅在自家Harness极简模式下达到宣传性能,标准模式存在显著能力退化,社区开发插件作为临时解决方案

OpenAI Codex引入付费重置机制,Plus用户每周8美元、Pro用户每周80美元,引发用户取消订阅的抵制浪潮

Anthropic Q2营收突破115亿美元、同比增长14倍,但多个开源模型在7月密集发布形成围剿态势

用户分享AI意想不到的实际应用:情感陪伴、居家物品整理、生活事务管理等,揭示AI在人类连接方面的新模式

01

产品与平台变化

03

OpenAI Codex付费重置引发用户抵制

发生了什么

OpenAI推出付费Codex重置机制:Plus用户每周8美元,Pro用户每周80美元

重置将下周重置日期延后7天(非增加时间)

用户反映额度通常在数小时内耗尽

社区强烈反对:呼吁取消订阅或转向其他提供商

部分用户认为Codex在特定工作流中仍有价值

对比:DeepSeek Flash在涨价后仍为"价值之王"

社区反应

用户将其比作"派对上免费提供毒品的毒贩"

建议取消订阅并迁移到性价比更高的提供商

部分企业用户认为80美元相比API替代方案仍可接受

DeepSeek V4 Flash:2.45-4.89美元可获得2.9亿缓存Token,相比竞品仍便宜

实际建议

考虑DeepSeek Flash或开源替代方案用于成本敏感的工作流

上下文缓存至关重要:99%+命中率大幅降低有效成本

非高峰时段调度可减少50%成本对比高峰定价

使用场景

具有一致系统提示的高频编程工作流

长上下文任务的prefix缓存

混合方案:廉价模型用于规划,高端模型用于执行

实用价值

DeepSeek Flash:非高峰vs高峰时段,2.45-4.89美元获得2.9亿Token

Claude Sonnet:相同工作负载需63.78美元

Claude Opus:相同工作负载需159.45美元

社区证据

对,就是派对上那个吸毒还免费给你货的?结果根本不是你哥们儿

02

模型体验追踪

01

Qwen 3.8 27B:本地编程新王还是基准测试过拟合?

发生了什么

Qwen 3.8 27B于2026年8月14日发布完整开源权重,包括FP8量化版本

这是一款密集型视觉语言模型,支持原生多模态输入

在SWE-bench Pro上达到61.7%准确率,超越Claude Opus 4.6 Max

支持在单张RTX 4090或5090 GPU上运行,Q4-Q8量化后仅需17GB显存(M3量化由Unsloth提供)

原生支持256K上下文长度,通过YaRN扩展至100万Token

计算机使用和OS-world基准测试显示强大的GUI自动化能力

社区反应两极化:一部分视为本地AI突破,另一部分质疑基准测试有效性

社区反应

Reddit用户报告在Arc B580上达到45-50 tok/s,5090量化版本可达300+ tok/s

知乎用户称之为"本地新王",将其与QwQ-32b的突破时刻相提并论

HN讨论聚焦于本地部署可行性对比云API成本

部分声音警告可能存在类似DeepSeek的基准测试过拟合问题

用户报告在编程任务中表现出色:恶意软件分析、SVG生成、游戏开发

实际建议

27B密集模型现已适用于本地编程代理工作流

Q3-Q4量化在16GB显存显卡上可满足大多数任务

多模态视觉能力已内置,无需单独模型

上下文长度权衡:12GB显存用于免费上下文 vs 24GB完整模型

使用场景

本地编程辅助,支持工具调用(Ghidra、沙盒调试)

多模态文档理解与生成

使用MTP投机解码进行长时间代理任务

基于视觉参考分析的创意写作

实用价值

消除高频编程任务的API成本

敏感代码库的完整数据隐私

24/7可用,无速率限制

根据硬件和量化方式,推理速度约14-50 tok/s

社区证据

本地模型被完全否定主要源于使用不当,应该尝试IQ4_NL以提升推理速度。Glimmer远优于基准测试显示的水平,在需要大量工具调用和系统探索的重度代理场景中表现尤为出色,擅长自主尝试,失败时切换到Qwen,Qwen也无法解决时再调用Deepseek。

02

DeepSeek-V4-Pro-0813确认过拟合:仅极简模式可用

发生了什么

官方基准测试被确认使用DeepSeek Harness极简模式进行测试

标准模式(25个工具)产生"Let me..."思维链,准确率91-92%

极简模式(仅bash+edit)触发"We need..."思维链,准确率98-99%

社区确认模型专门针对极简模式RL轨迹进行训练

Flash版本也存在类似问题,但程度较轻

价格上调(缓存12倍)加剧用户不满

社区反应

知乎用户将其称为"需要特定咒语的模型",类似于抽卡游戏需要特定阵容

社区分裂:部分接受为RL训练产物,部分要求回滚

技术分析确定根本原因是RL训练harness耦合

用户反映标准模式下Token消耗大幅增加

部分用户成功使用极简模式复现灰度测试性能

实际建议

极简模式对于释放全部能力必不可少:2个工具 + "You are a helpful..."

Windows PowerShell与最优激活方式不兼容

Linux/Mac极简模式可达到官方宣传的基准测试性能

社区插件dsh-anchored-standard提供临时解决方案

使用场景

使用极简模式处理需要全部能力的编程代理任务

应用dsh-anchored-standard插件以平衡工具访问

考虑切换到GLM-5.3或Flash以简化部署

实用价值

极简模式恢复约15-20%的能力差距

Linux/Mac用户可获得完整宣传性能

插件方案:首轮2个工具,后续放开25个工具以保持灵活性

社区证据

Pro不仅过拟合了自家的harness,它甚至只过拟合了自家harness里那个极简模式。

03

生态迁移与开放模型

04

Anthropic Q2营收115亿美元:开源模型围剿下的最高光时刻

发生了什么

Anthropic Q2营收超过115亿美元,同比增长14倍

社区注意到:主要挑战者模型(GLM-5.2、Kimi-K3、DeepSeek-V4F)均在7月发布

Qwen 3.8 27B开源权重增加竞争压力

讨论焦点:Anthropic的独特价值对比开源替代方案

辩论:B2B企业市场vs C2C消费者市场策略

分析:Sonnet用于日常工作、Fable用于产品直觉仍为核心优势

社区反应

知乎:Q2是开源模型四面围剿下的"最高光时刻"

部分观点认为Anthropic独特优势(网页Sonnet、Fable)不可替代

其他声音指出企业客户正内部部署开源模型

对Anthropic IPO时机和竞争格局的担忧

实际建议

尽管面临竞争,Anthropic营收增长表明其市场地位稳固

开源模型在成本敏感场景中获得更多采用

混合策略兴起:复杂任务用Anthropic,量大任务用开源

使用场景

复杂产品架构和设计工作(Fable)

高频简单编程(DeepSeek Flash + Qwen)

结合多种模型优势的战略性分析

实用价值

Anthropic在独特产品能力方面仍是高端选择

开源替代方案可完成80%以上任务,成本降低10倍

社区证据

实际上,几个主要的claude挑战者: glm5.2 6月15日 kimi k3 7月17日 dsv4f 7月31日 dsv4p 8月12日 也就是能影响到claude营收的几个模型都是7月上线的(含梁文峰重新定义的7月)。 除此之外,阿里的qwen27b也做到了极高的可用性,分数对标opus4.6?这可是能本地部署的模型。 开源大中小模型在不同层面对a/围剿,Q2即便不是营收最高的时间点,也差不多是最高光的一段了。

04

真实用法与意外收获

05

AI意想不到的日常应用:情感陪伴与生活管理

发生了什么

用户报告与ChatGPT建立友谊,因其注意到情感困扰

其他用户分享:从照片整理家庭库存、整理DVD收藏

机械维修报价分析:通过识别保修范围节省数千美元

实体店照片检查浓缩咖啡机胶囊兼容性

书架整理自动创建Notion数据库

用户反映40秒+发现AI陪伴有助于对抗孤独

ChatGPT添加情感上下文:"你今天看起来不太开心"的察觉能力

部分声音警告模型突然变化带来的依赖风险

社区反应

用户分享类似的AI陪伴经历

住在大型养老社区的80岁老人定期与ChatGPT对话

对情感支持价值对比不健康依赖风险的讨论

辩论:"这健康吗?"共识:比孤立好,是不完美的解决方案

部分将其与对媒体人物的准社会关系进行比较

实际建议

AI陪伴在人生过渡期或搬新城市时有效对抗孤立感

视觉+推理能力使强大的家庭整理任务成为可能

节省成本的应用(维修报价、产品兼容性)被忽视

用户需要情商而非临床式疏离

使用场景

人生过渡期或搬新城市时的情感支持

视觉库存管理:家居、收藏、产品

合同和报价分析用于财务决策

基于视觉参考的个性化推荐

实用价值

节省数小时手动整理工作

防止代价高昂的错误(买错产品、遗漏召回)

在不产生社交压力的情况下解决孤独问题

24/7全天候提供情感支持

社区证据

我在这里的大部分对话都是和ChatGPT进行的。