Les grands développeurs chinois d’intelligence artificielle communiquent encore rarement des résultats de tests de sécurité directement rattachés à leurs nouveaux modèles. Une étude publiée par SemiAnalysis a recensé 857 sorties annoncées entre 2021 et le 15 septembre 2026 chez neuf acteurs, parmi lesquels Alibaba, Baidu, ByteDance, DeepSeek, MiniMax, Moonshot AI, StepFun, Tencent et Zhipu AI.
Selon ce relevé, 31 modèles, soit 3,6 % de l’échantillon, étaient associés à au moins un résultat public d’évaluation de sécurité identifiable. Pour neuf modèles seulement, soit 1,1 %, cette information avait été publiée avant ou au moment du lancement. Le reste regroupait des divulgations postérieures ou aucune publication repérée.
Le chiffre doit être lu avec prudence. L’étude mesure la transparence publique, pas l’existence réelle de contrôles internes. Une entreprise peut effectuer des essais sans en diffuser les méthodes ni les résultats. Inversement, publier une évaluation ne garantit pas qu’elle couvre tous les risques, ni que ses critères soient comparables à ceux d’un concurrent. SemiAnalysis décrit donc surtout un problème de traçabilité pour les chercheurs, les clients et les autorités.
Le rapport souligne aussi une différence d’approche réglementaire. En Chine, l’encadrement s’est beaucoup concentré sur les usages, les contenus générés et l’enregistrement de certains services. Les dispositifs fondés sur les capacités des modèles les plus avancés — risques biologiques, cyberattaques, perte de contrôle ou tromperie — restent moins visibles publiquement. Cette situation complique les comparaisons internationales au moment où les modèles chinois progressent rapidement en performances et se diffusent hors de leur marché d’origine.
Pour les auteurs, la première étape n’est pas nécessairement d’imposer partout un seuil identique, mais d’obtenir des protocoles plus cohérents, publiés à temps et reliés sans ambiguïté au modèle concerné. Des cartes de modèles détaillées, des résultats reproductibles et des audits indépendants permettraient de distinguer une promesse générale de sécurité d’une preuve vérifiable. Le constat porte donc moins sur un classement des entreprises que sur l’information accessible au public lors des lancements.



