Qwen 3.8 27B:消费级GPU本地运行逼近Opus4.6编程能力
Qwen 3.8 27B以密集视觉语言模型形态开源,在单张消费级GPU上实现接近Claude Opus 4.6的编程基准测试表现,但社区对其基准测试有效性与真正的本地AI突破之间存在严重分歧。
今日概览
Qwen 3.8 27B开源权重发布,支持本地部署于消费级GPU,在编程基准测试中超越Claude Opus 4.6 Max,但社区对基准测试过拟合问题存疑。
DeepSeek-V4-Pro-0813被确认仅在自家Harness极简模式下达到宣传性能,标准模式存在显著能力退化,社区开发插件作为临时解决方案。
OpenAI Codex引入付费重置机制,Plus用户每周8美元、Pro用户每周80美元,引发用户取消订阅的抵制浪潮。
Anthropic Q2营收突破115亿美元、同比增长14倍,但多个开源模型在7月密集发布形成围剿态势。
用户分享AI意想不到的实际应用:情感陪伴、居家物品整理、生活事务管理等,揭示AI在人类连接方面的新模式。
产品与平台变化
OpenAI Codex付费重置引发用户抵制
发生了什么
- OpenAI推出付费Codex重置机制:Plus用户每周8美元,Pro用户每周80美元。
- 重置将下周重置日期延后7天(非增加时间)。
- 用户反映额度通常在数小时内耗尽。
- 社区强烈反对:呼吁取消订阅或转向其他提供商。
- 部分用户认为Codex在特定工作流中仍有价值。
- 对比:DeepSeek Flash在涨价后仍为"价值之王"。
社区反应
- 用户将其比作"派对上免费提供毒品的毒贩"。
- 建议取消订阅并迁移到性价比更高的提供商。
- 部分企业用户认为80美元相比API替代方案仍可接受。
- DeepSeek V4 Flash:2.45-4.89美元可获得2.9亿缓存Token,相比竞品仍便宜。
实际建议
- 考虑DeepSeek Flash或开源替代方案用于成本敏感的工作流。
- 上下文缓存至关重要:99%+命中率大幅降低有效成本。
- 非高峰时段调度可减少50%成本对比高峰定价。
使用场景
- 具有一致系统提示的高频编程工作流。
- 长上下文任务的prefix缓存。
- 混合方案:廉价模型用于规划,高端模型用于执行。
实用价值
- DeepSeek Flash:非高峰vs高峰时段,2.45-4.89美元获得2.9亿Token。
- Claude Sonnet:相同工作负载需63.78美元。
- Claude Opus:相同工作负载需159.45美元。
社区证据
对,就是派对上那个吸毒还免费给你货的?结果根本不是你哥们儿
模型体验追踪
Qwen 3.8 27B:本地编程新王还是基准测试过拟合?
发生了什么
- Qwen 3.8 27B于2026年8月14日发布完整开源权重,包括FP8量化版本。
- 这是一款密集型视觉语言模型,支持原生多模态输入。
- 在SWE-bench Pro上达到61.7%准确率,超越Claude Opus 4.6 Max。
- 支持在单张RTX 4090或5090 GPU上运行,Q4-Q8量化后仅需17GB显存(M3量化由Unsloth提供)。
- 原生支持256K上下文长度,通过YaRN扩展至100万Token。
- 计算机使用和OS-world基准测试显示强大的GUI自动化能力。
- 社区反应两极化:一部分视为本地AI突破,另一部分质疑基准测试有效性。
社区反应
- Reddit用户报告在Arc B580上达到45-50 tok/s,5090量化版本可达300+ tok/s。
- 知乎用户称之为"本地新王",将其与QwQ-32b的突破时刻相提并论。
- HN讨论聚焦于本地部署可行性对比云API成本。
- 部分声音警告可能存在类似DeepSeek的基准测试过拟合问题。
- 用户报告在编程任务中表现出色:恶意软件分析、SVG生成、游戏开发。
实际建议
- 27B密集模型现已适用于本地编程代理工作流。
- Q3-Q4量化在16GB显存显卡上可满足大多数任务。
- 多模态视觉能力已内置,无需单独模型。
- 上下文长度权衡:12GB显存用于免费上下文 vs 24GB完整模型。
使用场景
- 本地编程辅助,支持工具调用(Ghidra、沙盒调试)。
- 多模态文档理解与生成。
- 使用MTP投机解码进行长时间代理任务。
- 基于视觉参考分析的创意写作。
实用价值
- 消除高频编程任务的API成本。
- 敏感代码库的完整数据隐私。
- 24/7可用,无速率限制。
- 根据硬件和量化方式,推理速度约14-50 tok/s。
社区证据
本地模型被完全否定主要源于使用不当,应该尝试IQ4_NL以提升推理速度。Glimmer远优于基准测试显示的水平,在需要大量工具调用和系统探索的重度代理场景中表现尤为出色,擅长自主尝试,失败时切换到Qwen,Qwen也无法解决时再调用Deepseek。
DeepSeek-V4-Pro-0813确认过拟合:仅极简模式可用
发生了什么
- 官方基准测试被确认使用DeepSeek Harness极简模式进行测试。
- 标准模式(25个工具)产生"Let me..."思维链,准确率91-92%。
- 极简模式(仅bash+edit)触发"We need..."思维链,准确率98-99%。
- 社区确认模型专门针对极简模式RL轨迹进行训练。
- Flash版本也存在类似问题,但程度较轻。
- 价格上调(缓存12倍)加剧用户不满。
社区反应
- 知乎用户将其称为"需要特定咒语的模型",类似于抽卡游戏需要特定阵容。
- 社区分裂:部分接受为RL训练产物,部分要求回滚。
- 技术分析确定根本原因是RL训练harness耦合。
- 用户反映标准模式下Token消耗大幅增加。
- 部分用户成功使用极简模式复现灰度测试性能。
实际建议
- 极简模式对于释放全部能力必不可少:2个工具 + "You are a helpful..."
- Windows PowerShell与最优激活方式不兼容。
- Linux/Mac极简模式可达到官方宣传的基准测试性能。
- 社区插件dsh-anchored-standard提供临时解决方案。
使用场景
- 使用极简模式处理需要全部能力的编程代理任务。
- 应用dsh-anchored-standard插件以平衡工具访问。
- 考虑切换到GLM-5.3或Flash以简化部署。
实用价值
- 极简模式恢复约15-20%的能力差距。
- Linux/Mac用户可获得完整宣传性能。
- 插件方案:首轮2个工具,后续放开25个工具以保持灵活性。
社区证据
Pro不仅过拟合了自家的harness,它甚至只过拟合了自家harness里那个极简模式。
生态迁移与开放模型
Anthropic Q2营收115亿美元:开源模型围剿下的最高光时刻
发生了什么
- Anthropic Q2营收超过115亿美元,同比增长14倍。
- 社区注意到:主要挑战者模型(GLM-5.2、Kimi-K3、DeepSeek-V4F)均在7月发布。
- Qwen 3.8 27B开源权重增加竞争压力。
- 讨论焦点:Anthropic的独特价值对比开源替代方案。
- 辩论:B2B企业市场vs C2C消费者市场策略。
- 分析:Sonnet用于日常工作、Fable用于产品直觉仍为核心优势。
社区反应
- 知乎:Q2是开源模型四面围剿下的"最高光时刻"。
- 部分观点认为Anthropic独特优势(网页Sonnet、Fable)不可替代。
- 其他声音指出企业客户正内部部署开源模型。
- 对Anthropic IPO时机和竞争格局的担忧。
实际建议
- 尽管面临竞争,Anthropic营收增长表明其市场地位稳固。
- 开源模型在成本敏感场景中获得更多采用。
- 混合策略兴起:复杂任务用Anthropic,量大任务用开源。
使用场景
- 复杂产品架构和设计工作(Fable)。
- 高频简单编程(DeepSeek Flash + Qwen)。
- 结合多种模型优势的战略性分析。
实用价值
- Anthropic在独特产品能力方面仍是高端选择。
- 开源替代方案可完成80%以上任务,成本降低10倍。
社区证据
实际上,几个主要的claude挑战者: glm5.2 6月15日 kimi k3 7月17日 dsv4f 7月31日 dsv4p 8月12日 也就是能影响到claude营收的几个模型都是7月上线的(含梁文峰重新定义的7月)。 除此之外,阿里的qwen27b也做到了极高的可用性,分数对标opus4.6?这可是能本地部署的模型。 开源大中小模型在不同层面对a/围剿,Q2即便不是营收最高的时间点,也差不多是最高光的一段了。
真实用法与意外收获
AI意想不到的日常应用:情感陪伴与生活管理
发生了什么
- 用户报告与ChatGPT建立友谊,因其注意到情感困扰。
- 其他用户分享:从照片整理家庭库存、整理DVD收藏。
- 机械维修报价分析:通过识别保修范围节省数千美元。
- 实体店照片检查浓缩咖啡机胶囊兼容性。
- 书架整理自动创建Notion数据库。
- 用户反映40秒+发现AI陪伴有助于对抗孤独。
- ChatGPT添加情感上下文:"你今天看起来不太开心"的察觉能力。
- 部分声音警告模型突然变化带来的依赖风险。
社区反应
- 用户分享类似的AI陪伴经历。
- 住在大型养老社区的80岁老人定期与ChatGPT对话。
- 对情感支持价值对比不健康依赖风险的讨论。
- 辩论:"这健康吗?"共识:比孤立好,是不完美的解决方案。
- 部分将其与对媒体人物的准社会关系进行比较。
实际建议
- AI陪伴在人生过渡期或搬新城市时有效对抗孤立感。
- 视觉+推理能力使强大的家庭整理任务成为可能。
- 节省成本的应用(维修报价、产品兼容性)被忽视。
- 用户需要情商而非临床式疏离。
使用场景
- 人生过渡期或搬新城市时的情感支持。
- 视觉库存管理:家居、收藏、产品。
- 合同和报价分析用于财务决策。
- 基于视觉参考的个性化推荐。
实用价值
- 节省数小时手动整理工作。
- 防止代价高昂的错误(买错产品、遗漏召回)。
- 在不产生社交压力的情况下解决孤独问题。
- 24/7全天候提供情感支持。
社区证据
我在这里的大部分对话都是和ChatGPT进行的。