方法论

“public-community experience index, not a benchmark”

这个指数衡量什么

体感分是一个观察性指数:公开社区里的用户如何描述自己使用某个模型家族的体验——从真实评论中提取正负体验信号。它不是能力评测,也不能说明模型能力的强弱。

数据来源

我们分析 Reddit、Hacker News、知乎、小红书和 V2EX 上与 AI 相关的公开讨论样本。这不是对任何平台的全量普查,也不是能代表整体人群的抽样调查。每条评论经 LLM 流水线归类为按模型、按维度(编程、推理、安全拒答、速度……)的体验信号。总分对每条有效意见等权汇总;平台只用于来源拆分与审计,不参与加权。

Reddit

平台定位: 由共同兴趣组织起来的社区网络,用户可发帖、投票和评论。

典型声音: AI、模型、编程、产品及相关兴趣社区中的参与者,常分享亲自使用和横向比较工具、模型的经历。

采纳原因: 补充来自众多不同社区、以英语为主的广泛实用体验和跨模型比较。

Hacker News

平台定位: 以技术、创业、实质性交流与求知讨论为核心的社区。

典型声音: 工程师、创业者、研究人员及其他关注技术的读者,常讨论系统与产品。

采纳原因: 补充模型行为、版本变化、可靠性、延迟、成本与实现细节方面的讨论。

知乎

平台定位: 以问答为基础、围绕知识、经验和见解分享形成的中文内容社区。

典型声音: 求知用户、从业者和领域贡献者,常以提问、回答和较长解释展开讨论。

采纳原因: 补充中文语境下对输出质量、价格、工作流和模型选择决策的解释性经验。

小红书

平台定位: 围绕生活兴趣形成的社区,用户分享生活、学习、工作与创作体验。

典型声音: 普通用户、创作者、学生和职场人士,常描述 AI 在真实任务与日常流程中的使用感受。

采纳原因: 补充技术论坛较少覆盖的采用门槛、易用性、工作学习流程、创作使用和情绪反应。只纳入启用后创建的评论,不回填更早历史评论。

V2EX

平台定位: 面向开发者、设计师、创业者及其他互联网创作者的社区。

典型声音: 讨论产品、基础设施、工具链和日常运维的技术从业者。

采纳原因: 补充质量、延迟、价格、额度和集成方面的操作性反馈。只有官方托管模型服务的体验可计分;第三方工具和本地衍生版本只保留审计记录。

时间窗与阈值

主分数使用 7 日滚动窗口,脉冲使用 24 小时。低于最低样本阈值的模型或维度显示「样本不足」而不是分数。本站每个数字都标注样本量。

版本级分数

版本分只统计明确点名该版本的评论。「ChatGPT」「Claude」这类泛称只计入家族分,因此家族样本量通常更大。低于最低样本阈值的版本只展示提及量,不展示分数。

版本生命周期监控

生命周期页以发布后首个样本充分的 14 天作为固定基准,与最近 28 个完整 UTC 日比较。每日更新的 14 天滚动曲线用于展示变化路径,正式趋势判决仍使用互不重叠的独立 14 天分段。只纳入精确且明确归因到该版本的信号。各维度贡献会区分维度内口碑变化与讨论构成变化;它们用于解释分数变化,不能证明变化原因。

你的直接报告

一键报告是独立的第一方信号。我们按「哈希 IP × 模型 × 天」去重,从不存储原始 IP,只展示聚合计数。直接报告会与社区信号交叉校验以识别刷票,且不进入体感分本身。

诚实原则

所有变化都表述为用户感知的体验变化,而非模型能力结论。异常标注区分与公开事件的强匹配、弱匹配或无匹配。不知道的,我们直说不知道。