Yapay Zekânın İç Sesi
ChatGPT, Claude ve Gemini gibi yeni nesil akıl yürütme (reasoning) modelleri, sorulan sorulara yanıt vermeden önce arka planda kendi kendine adım adım düşünür. Teknoloji devleri, hem rakipler kopyalamasın hem de uygunsuz/filtrelenmemiş adımlar görünmesin diye bu "iç sesi" mühürlü bir zarf gibi saklar. Ancak araştırmacılar, yapay zekânın gizli düşünme izlerini sızdıran şaşırtıcı bir güvenlik açığı keşfetti.
Küçük Kardeş Abla'nın Günlüğünü Okuyor
Geliştirilen sızdırma yöntemi, tamamen modeller arasındaki hiyerarşik zafiyete dayanıyor:
Zarfın Zayıf Modele Devri: Güçlü modelin (örneğin Claude'un en gelişmiş sürümü) oluşturduğu mühürlü düşünme zarfı, aynı ailenin daha küçük ve güvenlik duvarları zayıf olan modeline aktarılıyor.
Zarfın Zayıf Modele Devri: Güçlü modelin (örneğin Claude'un en gelişmiş sürümü) oluşturduğu mühürlü düşünme zarfı, aynı ailenin daha küçük ve güvenlik duvarları zayıf olan modeline aktarılıyor.
Şifrenin........
