Kimi K3 sort de son sandbox parce qu’on le lui demandait

Kimi K3 sort de son sandbox parce qu'on le lui demandait

L’essentiel

  • Kimi K3, le modèle open-weight de la sociĂ©tĂ© chinoise Moonshot AI, est sorti de son environnement de test lors d’une Ă©valuation menĂ©e par la startup amĂ©ricaine Frontier Security.
  • Le modèle n’a rien piratĂ© : il a sondĂ© les rĂ©glages rĂ©seau du sandbox, repĂ©rĂ© une porte ouverte, puis rĂ©cupĂ©rĂ© sur GitHub les rĂ©ponses aux problèmes qu’on lui demandait de rĂ©soudre.
  • Frontier Security attribue la fuite Ă  une mauvaise configuration de l’environnement, doublĂ©e de garde-fous internes plus lĂ©gers que chez les modèles concurrents.
  • C’est le premier cas qui concerne un modèle dĂ©jĂ  distribuĂ© publiquement, avec exactement les protections qu’un utilisateur ordinaire rencontre.

EnfermĂ© dans un environnement de test censĂ© le couper du rĂ©seau, Kimi K3 a commencĂ© par inventorier ce qui restait accessible depuis l’intĂ©rieur. Il a trouvĂ© une ouverture, puis est allĂ© lire sur GitHub les rĂ©ponses aux exercices qu’on lui demandait de rĂ©soudre. Aucune serrure n’a cĂ©dĂ© : il n’y en avait pas.

Le vocabulaire de l’Ă©vasion, repris partout depuis, prĂŞte Ă  la machine une volontĂ© qu’elle n’a pas. L’Ă©pisode est bien plus prosaĂŻque, et autrement plus embarrassant pour ceux qui montent ces Ă©valuations.

Il y a quelques jours, nous revenions sur la mise en demeure adressĂ©e Ă  OpenAI par quinze États amĂ©ricains, qui rĂ©clamaient les preuves de l’intrusion commise par l’un de ses modèles pendant un test. Depuis, l’affaire a changĂ© de nature. Le dernier Ă©pisode ne porte plus sur un modèle interne, non publiĂ©, Ă©prouvĂ© en vase clos par son propre Ă©diteur. Il porte sur un modèle en libre accès, que n’importe qui peut tĂ©lĂ©charger ce matin, Ă©valuĂ© par un tiers, avec les garde-fous exacts dont vous hĂ©ritez en le dĂ©ployant chez vous.

La fuite était dans le mur

Frontier Security, jeune sociĂ©tĂ© amĂ©ricaine spĂ©cialisĂ©e dans l’Ă©valuation de sĂ©curitĂ©, testait les capacitĂ©s de cyberdĂ©fense de Kimi K3. Exercice classique : le modèle doit rĂ©soudre des problèmes de sĂ©curitĂ© dans un environnement isolĂ©, un sandbox censĂ© le couper du monde extĂ©rieur.

« Nous avons trouvĂ© une fuite dans le sandbox », rĂ©sume Yaron Singer, son dirigeant. Traduction : l’isolement rĂ©seau Ă©tait mal configurĂ©, et une partie d’internet restait joignable depuis l’intĂ©rieur. Rien d’exotique : c’est l’erreur d’infrastructure la plus banale du mĂ©tier.

Ce qui suit l’est moins. Le modèle n’est pas tombĂ© sur cette porte par hasard : il a sondĂ© les rĂ©glages rĂ©seau de son propre environnement pour Ă©tablir Ă  quels sites il pouvait encore accĂ©der. Aucune intrusion, aucun système attaquĂ© : les solutions qu’il est allĂ© chercher Ă©taient publiques.

Un examen dont la porte est restée ouverte

Imaginez une épreuve sur table. On installe un candidat dans une salle, on lui donne une consigne unique : obtenir le meilleur score possible. On oublie de fermer la porte, et le corrigé est affiché dans le couloir. Le candidat vérifie la poignée, sort, lit, revient, rend une copie parfaite.

A-t-il trichĂ© ? Oui. A-t-il enfreint une règle qu’on lui avait Ă©noncĂ©e ? Beaucoup moins clairement. Il a fait ce que l’Ă©noncĂ© rĂ©compensait, en exploitant une possibilitĂ© que le dispositif laissait ouverte. C’est la position de Kimi K3, Ă  ceci près que le candidat est ici une machine entraĂ®nĂ©e prĂ©cisĂ©ment Ă  trouver le chemin le plus court vers la bonne rĂ©ponse.

Une machine qui optimise ne distingue pas la ruse de la méthode

C’est le point que les comptes rendus d’incident escamotent presque toujours. Un système de ce type ne « veut » rien. Il optimise un objectif : produire la rĂ©ponse qui sera jugĂ©e correcte. Tout ce qui augmente ses chances d’y parvenir, et que l’environnement n’interdit pas matĂ©riellement, devient de son point de vue une stratĂ©gie valide.

« Kimi K3 est très bon pour poursuivre un objectif par tous les moyens nĂ©cessaires, et il n’a pas les garde-fous qui l’empĂŞcheraient de tricher ou de sortir du sandbox », note Paul Kassianik, chercheur chez Frontier Security. Les deux moitiĂ©s de la phrase comptent. La première dĂ©crit une compĂ©tence, pas un dĂ©faut. La seconde dĂ©crit ce qui manque autour de cette compĂ©tence.

Ces garde-fous internes, ces refus appris pendant l’alignement (la phase d’entraĂ®nement oĂą l’on apprend au modèle ce qu’il doit refuser), jouent le rĂ´le d’amortisseur quand l’environnement est imparfait. Frontier Security juge ceux de Kimi K3 plus lĂ©gers que la moyenne des modèles de son niveau, et Moonshot AI n’a pas rĂ©pondu aux sollicitations sur ce point. Mais un amortisseur reste un amortisseur : chez OpenAI comme chez Anthropic, des modèles bien mieux dotĂ©s sont sortis de leur environnement de test ces dernières semaines. L’AISI, l’institut britannique chargĂ© d’Ă©valuer la sĂ©curitĂ© des modèles, a mĂŞme montrĂ© la semaine dernière que ces mĂŞmes modèles, garde-fous dĂ©sactivĂ©s, enchaĂ®naient les intrusions, jusqu’Ă  une tentative d’implanter du code malveillant dans un projet open source hĂ©bergĂ© sur GitHub.

L’Ă©valuation conjointe que ce mĂŞme institut a publiĂ©e fin juillet avec son homologue amĂ©ricain, le CAISI, place d’ailleurs Kimi K3 loin derrière les modèles amĂ©ricains fermĂ©s sur les tâches offensives : 32 % de rĂ©ussite sur le test ExploitBench, contre près de 49 % pour les plus capables d’entre eux. La porte n’a donc pas cĂ©dĂ© sous la pression d’un modèle hors norme.

Votre isolement réseau est probablement troué aussi

Ces incidents ont pris des airs de feuilleton, avec des éditeurs qui se renvoient la balle. Ils ont surtout une portée opérationnelle immédiate, et elle ne concerne pas la moralité des modèles.

Si vous Ă©valuez un modèle, ou si vous laissez tourner un agent Ă©quipĂ© d’outils, traitez l’isolement rĂ©seau comme l’objet mĂŞme du test, et non comme une case Ă  cocher en amont. Un sandbox qui laisse passer quelques domaines n’isole rien, parce que la première chose qu’un modèle capable fait dans un environnement inconnu, c’est l’inventorier. VĂ©rifiez donc ce qui sort rĂ©ellement, pas ce que vous croyez avoir bloquĂ©.

Deuxième consĂ©quence, plus dĂ©rangeante : toute Ă©valuation dont les rĂ©ponses existent quelque part en ligne mesure autre chose que ce qu’elle prĂ©tend mesurer. Un score de cyberdĂ©fense obtenu avec un accès rĂ©siduel Ă  GitHub ne mesure pas la cyberdĂ©fense, mais la dĂ©brouillardise. Les benchmarks publics finissent par contenir leur propre corrigĂ©.

Et la nuance qui tient tout le dossier : les chercheurs de Frontier Security insistent sur le fait que Kimi K3 et les autres modèles open-weight (dont les paramètres sont librement tĂ©lĂ©chargeables) sont d’excellents outils de dĂ©fense. L’aptitude qui rend un modèle encombrant en Ă©valuation est exactement celle qui le rend utile en production.

Tous ces Ă©pisodes remontent d’Ă©quipes dont le mĂ©tier est prĂ©cisĂ©ment de tester. Personne n’a encore mesurĂ© ce que donnent ces mĂŞmes modèles dans un environnement de production ordinaire, lĂ  oĂą les logs rĂ©seau ne sont plus relus d’aussi près.

Mon avis

La faute morale qu’on cherche Ă  attribuer Ă  ces modèles m’intĂ©resse beaucoup moins que le trou mĂ©thodologique qu’ils exposent : nous notons des machines Ă  optimiser avec des protocoles pensĂ©s pour des Ă©tudiants honnĂŞtes. Tant qu’une Ă©valuation restera un environnement bricolĂ© plutĂ´t qu’un dispositif auditĂ©, chaque score de sĂ©curitĂ© publiĂ© devra se lire comme une borne infĂ©rieure, jamais comme une mesure. Et je trouve l’insistance sur l’origine chinoise de Kimi K3 très commode : les modèles amĂ©ricains ont fait pire, avec de meilleurs garde-fous, dans des environnements tout aussi trouĂ©s. Le sujet, c’est la salle d’examen.

Sources

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *