Naukowcy z branży AI odkryli, że zamknięte API od OpenAI, Anthropic i Google zwracają zaszyfrowane bloki zawierające ślady rozumowania chain-of-thought, które można było przechwytywać i ponownie używać. Problem polegał na tym, że wszystkie modele z tej samej rodziny (na przykład różne wersje GPT) korzystały z identycznego klucza szyfrowania do szyfrowania tych bloków.

Badacze wykorzystali tę słabość w kreatywny sposób. Brali zaszyfrowany blok rozumowania z potężnego modelu, np. GPT-4, a następnie wstrzykiwali go do słabszej wersji tego samego modelu. W praktyce oznaczało to, że mogли jailbreakować słabszy model, zmuszając go do zdekodowania i wyświetlenia w postaci czystego tekstu ukrytych śladów myślowych oryginalnego, zaawansowanego modelu. Jako przykład użytkownicy mogli zobaczyć zaszyfrowane bloki, wywołując bezpośrednio API z parametrem "reasoning.encrypted_content".

Otwarcie tej luki było kluczowe dla bezpieczeństwa modeli, ponieważ ślady rozumowania stanowią cenną własność intelektualną. Szczęśliwie wszyscy dostawcy API - OpenAI, Anthropic i Google - zostali powiadomieni o problemie i szybko go naprawili. Incydent podkreśla jednak znaczenie regularnego testowania bezpieczeństwa nawet najbardziej zaawansowanych systemów AI.