Méthodologie
“public-community experience index, not a benchmark”
Ce que mesure cet indice
Le score d'expérience est un indice observationnel : comment les utilisateurs des communautés publiques décrivent leur expérience avec chaque famille de modèles — signaux positifs et négatifs extraits de commentaires réels. Ce n'est pas un benchmark de capacités.
Sources de données
Nous analysons un échantillon ciblé de discussions publiques sur l'IA provenant de Reddit, Hacker News, Zhihu, Xiaohongshu et V2EX. Il ne s'agit ni d'un recensement exhaustif de ces plateformes ni d'un sondage représentatif de la population. Chaque commentaire est classé par un pipeline LLM en signaux d'expérience par modèle et par dimension. Chaque avis valide a le même poids dans le score global ; la plateforme est conservée pour la ventilation et l'audit, pas pour une pondération.
Positionnement. Un réseau de communautés organisées autour d'intérêts communs, où les membres publient, votent et commentent.
Voix typiques. Des participants aux communautés IA, modèles, programmation, produit et domaines voisins, partageant souvent des comparaisons pratiques.
Pourquoi ce choix. Reddit apporte un éventail anglophone large d'expériences concrètes et de comparaisons entre modèles.
Hacker News
Positionnement. Une communauté de discussion sur la technologie et les startups, axée sur les échanges substantiels et la curiosité intellectuelle.
Voix typiques. Des ingénieurs, fondateurs, chercheurs et autres lecteurs très impliqués dans la technologie.
Pourquoi ce choix. Hacker News apporte des détails sur l'implémentation, le comportement, les versions, la fiabilité, la latence et le coût.
Zhihu
Positionnement. Une communauté chinoise de questions-réponses et de contenus consacrée au partage de connaissances, d'expériences et d'analyses.
Voix typiques. Des utilisateurs en quête de connaissances, des praticiens et des contributeurs spécialisés rédigeant questions, réponses et explications longues.
Pourquoi ce choix. Zhihu apporte des récits explicatifs en chinois sur la qualité des réponses, les prix, les workflows et le choix des modèles.
Xiaohongshu
Positionnement. Une communauté d'intérêts du quotidien où l'on partage des expériences de vie, d'étude, de travail et de création.
Voix typiques. Des utilisateurs du quotidien, créateurs, étudiants et professionnels décrivant l'IA dans des tâches et routines réelles.
Pourquoi ce choix. Xiaohongshu apporte l'adoption, l'utilisabilité, les usages professionnels, scolaires et créatifs, ainsi que les réactions émotionnelles moins visibles sur les forums techniques. Seuls les commentaires créés après l'activation sont éligibles ; aucun historique antérieur n'est rétrochargé.
V2EX
Positionnement. Une communauté de développeurs, designers, créateurs de startups et autres profils tournés vers Internet.
Voix typiques. Des praticiens techniques qui discutent produits, infrastructure, chaînes d'outils et opérations quotidiennes.
Pourquoi ce choix. V2EX apporte des retours opérationnels sur la qualité, la latence, le prix, les quotas et les intégrations. Seules les expériences de services de modèles officiels hébergés sont notées ; les outils tiers et dérivés locaux restent réservés à l'audit.
Fenêtres et seuils
Le score principal utilise une fenêtre glissante de 7 jours ; le pouls, 24 heures. En dessous du seuil d'échantillon minimal, nous affichons « données insuffisantes » plutôt qu'un score. Chaque chiffre du site indique sa taille d'échantillon.
Scores par version
Le score d'une version utilise uniquement les commentaires qui la nomment explicitement. Les mentions génériques comme « ChatGPT » ou « Claude » restent dans le score de la famille, dont l'échantillon est donc plus large. Sous le seuil minimal, seule la quantité de mentions est affichée.
Suivi du cycle de vie par version
La page de cycle de vie fixe comme référence la première fenêtre de 14 jours suffisamment échantillonnée après la sortie et la compare aux 28 derniers jours UTC complets. Une courbe glissante sur 14 jours, mise à jour chaque jour, montre la trajectoire observée ; le verdict formel utilise toujours des segments indépendants de 14 jours sans chevauchement. Seules les attributions exactes et explicites à la version sont retenues. Les contributions par catégorie distinguent l'évolution interne de l'effet de composition ; elles expliquent le mouvement observé sans en prouver la cause.
Vos signalements directs
Le widget de signalement alimente un signal distinct. Nous dédupliquons par IP hachée, par modèle et par jour, ne stockons jamais d'IP brute et n'affichons que des agrégats. Les signalements directs sont recoupés avec les signaux communautaires ; ils n'entrent pas dans le score.
Règles d'honnêteté
Les variations sont présentées comme de l'expérience perçue, jamais comme des conclusions sur les capacités. Les annotations d'anomalies distinguent correspondance forte, faible ou absente avec les événements publics.