Fable 5 Güvenlik Önlemlerini İyileştirme
Claude Fable 5'in biyoloji güvenlik önlemlerinde yapılan güncellemeler, yanlış pozitif sonuçları önemli ölçüde azaltıyor.
Claude Fable 5'in biyoloji güvenlik önlemlerinde, yanlış pozitif sonuçları önemli ölçüde azaltan güncellemeler yapıyoruz. Fable 5 kullanıcıları artık çok daha az sayıda "fallback" yaşayacaklar—sistem biyoloji ile ilgili bir sorgu aldığında daha az yetenekli bir modele geçiş yapıyordu. Testlerimizde, bu güncelleme ürün yüzeylerimiz genelinde biyoloji ile ilgili fallback'leri yaklaşık %85 oranında azalttı.1
Fable 5 artık daha geniş bir yelpazedeki biyoloji görevlerine yardımcı olabilecek.
Uygulamada, kullanıcılar günlük sağlık ve eğitim soruları konusunda çok daha az fallback görecekler—örneğin lab sonuçlarını yorumlama, semptomları anlama ve eğitim bağlamında biyoloji öğrenme. Sağlık profesyonelleri, Fable 5'ten klinik görevler konusunda daha fazla destek alabilecekler.
AI'nin dünyaya olumlu etki yapmasının en büyük fırsatının biyoloji ve tıp alanında olduğuna inanıyor ve biyologların frontier'a erişmesi için sorumlu bir yol inşa etmeye önemli ölçüde yatırım yapıyoruz. Bugün Fable, viriyoloji, toksikoloji ve moleküler tasarım dahil olmak üzere çift amaçlı olarak değerlendirdiğimiz istekler için hala Opus 5'e fallback yapıyor—bu nedenle profesyonel biyoloji araştırması ve ilaç geliştirme için henüz kullanılabilir değil. Frontier biyoloji yeteneklerine yönelik güvenilir erişim yolları aracılığıyla bu boşluğu kapatmaya kararlıyız.
Hedefimiz, Fable 5'in frontier yeteneklerini mümkün olduğu kadar çok kullanıcımızın eline, mümkün olduğu kadar hızlı bir şekilde ulaştırmaktır. Ancak bunu yapabilmek için, bu kadar yetenekli modellerin getirdiği artan riskleri yönetmemiz gerekir. Böyle bir risk biyoloji alanındadır: Fable 5 artık bazı oldukça karmaşık biyolojik görevlerde uzmanları aşabilir ve diğerlerinde operasyonel destek sağlayabilir. Bu, yeni bir tıbbi tedavi geliştiren bir araştırmacıya gerçek yardım sağlayabileceği anlamına gelir (bu, hem sınıflandırıcı iyileştirmeleri hem de güvenilir erişim programları aracılığıyla modele erişimi genişletmek için bu kadar hevesli olmamızın nedenidir). Ancak yanlış ellerde, aynı yetenekler kötü niyetli bir aktör tarafından—örneğin biyolojik bir silah geliştirmede—kullanılabilir. Yetenek değerlendirmelerimiz, Fable 5'in böyle bir aktöre önemli bir uplift sağlayabileceğini gösteriyor—yani başka hiçbir yerde bulamayacakları yetenekler sağlayabilir.
Biyolojide AI'nin faydalı ve zararlı kullanımlarını ayırt etmek çoğu zaman zordur. Örneğin, bazı durumlarda bir hastalığın tedavisini araştırmak, bilim insanlarının söz konusu hastalığa neden olan tehlikeli bileşikleri üretmesini gerektirir. Bu, canlı aşılar için en açık hale gelir; bu aşılar, bilim insanlarının önlemek amaçladıkları aynı patojeni yetiştirmesini gerektirir. Bazı ilaçlar için de durum böyledir. Hipertansiyonu tedavi eden ilaç captopril'i geliştirmek için, bilim insanları insan kanında kan basıncını düşüren yılan zehirinin toksik bileşenlerini izole ettiler. Frontier'da yeni biyolojik yetenekler geliştikçe, bu yeni yeteneklerin oluşturduğu risklerin, potansiyel bilimsel yararlarından önce ortaya çıkmadığından emin olmak için dikkatli olmalıyız.
Modellerimizi zararlı amaçlarla kullanmak isteyen sofistike aktörler, niyetlerini gizlemek ve tehlikeli görevleri sıradan araştırma çalışmalarına benzetmek için bu belirsizlikten yararlanmayı bilir. ABD İstihbarat Topluluğunun 2026 Yıllık Tehdit Değerlendirmesi, böyle aktörlerin var olduğunu ve sentetik biyoloji ve genomik düzenleme dahil biyoteknoloji alanındaki ilerlemelerin "yeni biyolojik tehditlere yol açabileceğini" açıkça ortaya koyuyor. Birkaç devlet aktörünün, frontier AI modellerinin ham yeteneklerine erişerek hızlandırılabilecek aktif taarruzi biyolojik ve kimyasal silah programlarını muhtemelen koruduğunu not ediyor.
Bu "çift amaçlı" yetenekler (faydalı veya zararlı amaçlarla kullanılabilecek ve bu ikisi arasındaki sınırın her zaman net olmadığı alanlar) hakkındaki endişelerimiz nedeniyle, Fable 5'i neredeyse tüm biyoloji sorguları engellenerek kasıtlı olarak piyasaya sürdük. Bu, kullanıcıların diğer alanlardaki model için erişim sağlamasını sağladı. Bunun meşru biyoloji kullanıcıları için sinir bozucu olacağını biliyorduk: bu, kullanıcıların biyoloji ile ilgili sorular sorması halinde isteklerinin engellenmesine ve daha az yetenekli bir modele gönderilmesine neden olacak yüksek sayıda yanlış pozitif sonuçla sonuçlanacaktı. Buna rağmen, Fable'ın biyoloji gibi çift amaçlı bir alanda yanlış kullanılmasının maliyetinin potansiyel olarak felaket olabileceği için bu takasımı yapmayı tercih ettik.
Biyolojide kötüye kullanıma karşı korunmanın temel yollarından biri güvenlik sınıflandırıcıları: Fable 5'den korumalı bir biyoloji görevini yapması istendiğinde veya zararlı bir çıktı üretmek istendiğinde algılayan daha küçük, otomatikleştirilmiş AI sistemleridir (siber güvenlik alanında benzer sınıflandırıcılarımız hakkında daha önce yazmıştık).
Fable 5 söz konusu olduğunda, bir sınıflandırıcı tetiklendiğinde, modelin kullanıcının isteğini Opus 5'e yönlendirir—Fable 5 ile aynı düzeyde biyolojik yeteneğe sahip olmayan ve kötü niyetli bir kullanıcıya bu kadar yardım sağlayamayan yetenekli bir model. Bu, kullanıcıların isteklerinin engellendiğinde gördüğü fallback'tir.
Kesin ve sağlam sınıflandırıcılar geliştirmek basit bir görev değildir. Bir sınıflandırıcının hızlı ve tutarlı bir şekilde çalışması için, potansiyel olarak zararlı olduğunu düşündüğümüz konular ve sorgular için "kapsam içi" ve "kapsam dışı" arasındaki farkı öğrenmesi gerekir. Sınıflandırıcıları ayarlamak, hem yanlış pozitif sonuçları (sınıflandırıcıların kapsam dışı içeriklerde tetiklenmesi) hem de yanlış negatifleri (kapsam içi içeriklerin kaçırılması) önlemek için zaman ve yineleme gerekir. Ayrıca sınıflandırıcılarımızın onları aşma girişimlerine karşı dayanıklı olmasını (jailbreak'ler olarak bilinir) istiyoruz; bu da daha fazla araştırma ve test gerektirir.
Çok geniş bir biyoloji sınıflandırıcı ile başlamak, araştırmamız sayesinde kullanıcılarımıza Fable 5'e erişim sağlarken onu geliştirmeyi hedeflediğimiz anlamına geliyordu. Alternatif—koruma ilerlemesinin çok daha fazla yapılması beklenene kadar modeli tutmak—modelin genel erişimini ve kullanıcılarımız için potansiyel faydalarını haftalar veya aylar geciktirmiş olurdu.
Geçtiğimiz birkaç hafta içinde, sınıflandırıcının anayasasını (iyi ve kötü arasında ayırt etmeye yardımcı olmak için bir kural koleksiyonundan oluşan) dikkatlice yeniden yazdık ve masum kullanımları detaylı olarak ayırdık. Değişiklikler hakkında geri bildirim istendik çeşitli uzmanlardan (hem Anthropic'in içinden hem de dışından). Daha sonra bu anayasaya dayalı olarak sınıflandırıcı için güncellenmiş eğitim verileri geliştirdik, yeniden eğittik ve yeni sınıflandırıcının hala zararlı ve çift amaçlı araştırma biyolojisi içeriğinde genel olarak tetikleneceğini ancak artık daha geniş bir masum ve faydalı kullanım yelpazesini etkinleştireceğini doğruladık.
Aşağıdaki diyagramda gösterildiği gibi, bu güncellemeler—Fable 5'in piyasaya sürüldüğü zamana kıyasla—sınıflandırıcının çok daha az sayıda masum biyoloji ile ilgili istekte tetikleneceği anlamına geliyordu.
Sonuçlar
Korumalarımızı geliştirmek için hala yapılması gereken çok daha fazla şey var. Yanlış pozitif sonuçlar kaçınılmaz olarak kalacak—sınıflandırıcının güvenlik kenarında kalan çok düşük riskli istekler ancak sınıflandırıcı hala tetiklenebilir. Yukarıda belirttiğimiz gibi, Fable, potansiyel çift amaçlı risk nedeniyle profesyonel biyoloji ve ilaç geliştirme sorgularını engellemeye devam edecek. En yetenekli modellerimizi araştırmacılar tarafından güvenilir erişim yolları aracılığıyla kullanmak için güvenli ve ölçeklenebilir bir yol geliştirmeye tam olarak kararlıyız.
Korumaları daha da iyileştirmek için geri bildiriminizi bizimle paylaşmaya devam edeceğinizi umuyoruz.