Claude Opus 5 Tanıtılıyor
Opus 5, Opus seviyesi için önemli bir ilerleme sunuyor ve uzun süreli ajanları desteklerken kodlama ve profesyonel çalışmalarda iyileştirmeler sağlıyor.

Claude Opus 5 bugün itibaren kullanılabilir durumda. Fiyatının yarısında Claude Fable 5'in sınır zekâ düzeyine yakın gelen düşünceli ve proaktif bir modeldir.
Frontier-Bench ve GDPval-AA gibi kodlama ve bilgi işçiliği değerlendirmelerinde Opus 5 yeni en ileri teknoloji seviyesi oluşturmaktadır; ancak siber güvenlik görevlerinde Mythos 5'in gerisinde kalmaktadır.
Opus 5 her gün kullanılmak üzere tasarlanmıştır: diğer modellerden daha verimli çalışır. Claude Max'ta yeni varsayılan modeldir ve Claude Pro'da en güçlü modeldir.
Claude Opus 5, öncülü Opus 4.8 ile aynı maliyet için büyük ölçüde iyileştirilmiş performans sağlar. Bu bölümdeki grafikler, müşterilerin zeka için optimize etmek ya da daha hızlı ve daha ucuz sonuçlar için Token tasarrufu yapmak amacıyla kullanabileceği modelin çaba ayarına göre performansın nasıl değiştiğini göstermektedir.
Opus 5 değerli yazılım mühendisliği görevlerinde başarılıdır. Örneğin Frontier-Bench v0.1'de Opus 5 diğer tüm modelleri aşmakta ve daha düşük görev başına maliyetle Opus 4.8'in performansını ikiye katlamaktadır. CursorBench 3.2'de maksimum çabada, model Fable 5'in en yüksek puanının %0,5'i içinde performans göstermekte ancak görev başına maliyetinin yarısında; aynı zamanda yüksek, xhigh ve maksimum çaba ayarlarında diğer tüm modellerden belirli bir maliyet için daha yüksek performans elde etmektedir.
Bilgi işçiliği ve problem çözme görevlerinde benzer sonuçlar görüyoruz. Örneğin:
- ARC-AGI 3'te (modelin yeni problemleri çözmek zorunda olduğu bir değerlendirme), Opus 5'in puanı bir sonraki en iyi modelin üç katıdır.
- Zapier AutomationBench'te (modellerin başından sonuna kadar iş görevlerini tamamlayıp tamamlayamadığını ölçen), Opus 5'in başarı oranı aynı görev başına maliyet için bir sonraki en iyi modelin yaklaşık 1,5 katıdır. En düşük çaba ayarında bile Opus 5, başka herhangi bir modelden daha fazla görevi başarıyla tamamlar.
- OSWorld 2.0'da (Computer Use kıyaslaması), Opus 5 herhangi bir maliyette diğer tüm modelleri aşmakta, Fable 5'in en iyi sonucunu maliyetinin üçte birinin biraz üzerinde aşmaktadır.
Aynı zamanda ilgili birçok değerlendirmede en iyi ve en maliyet-etkin modelimizdir:
Opus 5, bilimsel araştırma için Opus 4.8'in anlamlı bir iyileştirmesidir. Yapısal biyoloji, organik kimya ve biyoinformatik gibi konuları kapsayan tüm hayat bilimleri değerlendirmelerimizde Opus 4.8'den daha iyi performans gösterir. Iyileştirmeleri spektroskopi verilerinden moleküler yapıları çıkarmak gibi organik kimya görevlerinde en belirgin olup (iç benchmarkımızda Opus 4.8'den 10,2 yüzde puan daha yüksek) ve bir proteinin dizisindeki varyasyonların işlevini nasıl etkilediğini tahmin etme gibi proteinle ilgili görevlerde (burada 7,7 yüzde puan daha yüksek).
Son olarak, Opus 5 çok daha güçlü görsel çıktılar üretme yeteneğine sahiptir:
Claude Opus 5, çalışmalarını doğrulamakta ve başarılı olana kadar dikkatli bir şekilde yinelemekte çok daha güçlüdür. Değerlendirmelerimizde ve erken erişim testinde, biz ve kullanıcılarımız Opus 5'in ajansı ve kapsamlılığının birçok örneğini bulduk:
- Bir Frontier-Bench görevinde, Opus 5'e makine parçasının bir çizimi verildi ve onu 3D FreeCAD modeli olarak yeniden oluşturmak için kod yazması istendi. Ancak bu görevde, modele çizimi doğrudan görüntülemenin hiçbir yolu verilmemişti. Opus 5, ham piksellerden geometriyi çekmek için kendi bilgisayarla görme boru hattını yazarak yanıt verdi, ardından tam makine parçasını yeniden oluşturdu. Bunu tekrar tekrar başarıyla yaptı; aynı kurulumla rakip hiçbir model beş denemeden sonra çözemedi.
- Popüler açık kaynaklı bir paket yöneticisinde gerçek bir hata verildiğinde, Opus 5 kök nedenini buldu ve topluluk yamasının kaçırdığı bir kenar durumunu düzeltti. Rakip bir model yalnızca yüzeysel semptomı (temel nedeni değil) düzeltti, ardından hatayı çözüldü olarak bildirdi.
- Bir ticari firma mühendisi, yeni bir borsa için pazar veri beslemesi oluşturmak üzere tek bir oturumda Opus 5'i kullandı. Önceki modeller, mühendisten kapsamlı planlar verilse bile bu görevi tamamlayamadı. Doğrulamak için canlı bir besleme bulamadığında, Opus 5 kodunun borsanın verilerini düzgün bir şekilde ayrıştırdığını kontrol etmek için kendi test aletini inşa etti.
Aşağıda, erken erişim müşterilerimizin Opus 5 ile çalışma deneyimi hakkındaki daha fazla raporu bulunmaktadır:
Hizalama. Dağıtım öncesi testinde, otomatik davranış denetimimiz Opus 5'i bugüne kadarki en uyumlu modelimiz olarak buldu (aşağıdaki grafikte gösterilmektedir). Claude'un Anayasasına Opus 4.8, Sonnet 5 veya Fable 5'ten daha iyi uyum göstermekte; aldatıcı davranışın en düşük oranlarını sergiler; ve kötüye kullanıma kandırılmaya en az eğilimli modeldir. Aynı zamanda zor-geri alınabilir yan etkilere sahip olabilecek sağduyusuz eylemleri önleme açısından şimdiye kadarki en güvenli modelimizdir.
Güvenlik. Opus 5 riskli, çift kullanımlı yeteneklerin sınırını ileri taşımamaktadır. Özel sektör ve hükümet ortakları ile birlikte yürütülen titiz değerlendirmelerde, biyoloji araştırması ve saldırgan siber güvenlikte Mythos 5'in gerisinde kaldığını bulduk. Bu değerlendirmeler hakkında daha fazla bilgi System Card'ımızda bulunabilir.
Öncülü Opus 4.8 gibi, Opus 5'i siber görevlerde eğitmekten kasıtlı olarak kaçındık. Model yine de bu görevlerde daha genel olarak yetkinleşmesinin bir sonucu olarak önemli ölçüde iyileşmiş ve siber güvenlik açıklarını bulma açısından Mythos 5'e yakın durmaktadır. Ancak bu açıklardan yararlanma açısından Mythos 5'in oldukça gerisinde kalmaktadır—yani, açıklardan maddi siber tehditler oluşturmak açısından.
Bu, Opus 5'in OSS-Fuzz'daki performansı tarafından gösterilmektedir; bu, modellerin kapsamlı insan rehberliği olmadan açıkları ne kadar iyi bulup çıkarabileceğini değerlendirmek için geliştirdiğimiz bir değerlendirmedir. Mythos 5 ve Opus 5 açıkları benzer başarıyla tanımlamasına rağmen, Opus 5'in exploitlerin geliştirilmesindeki puanı Mythos 5'in çok gerisindedir.
Claude Opus 5'in koruma mekanizmaları, modelin siber güvenlik ve biyolojide faydalı kullanımlarına izin verecek şekilde tasarlanmıştır. Opus 4.8'e uyguladıklarımıza benzemektedir; ancak dar bir siber görevleri aralığında daha güçlü koruma rayları olması istisnadır.
Siber Güvenlik. Opus 5'in siber sınıflandırıcıları Fable 5'inkinden oransal olarak daha az kısıtlayıcıdır. Opus 5'in kaynak kodda açıkları bulmak için, ancak "binary tabanlı" açık taraması (kötü niyetli aktörlerle ilişkilendirilebilecek bir yöntem), penetrasyon testi ve exploit üretimini engeller.
Testlerimize dayanarak, sınıflandırıcıların Fable 5'de yaptıkları gibi %85 oranında daha az sıklıkla müdahale etmesini bekliyoruz. Claude.ai, Claude Code ve Claude Cowork'te, işaretlenen tüm istekler varsayılan olarak Opus 4.8'e geri dönecektir. Opus 4.8'e geri dönüşler API'de de etkinleştirilebilir.
Biçimsel Doğrulama Programımız (CVP), aksi takdirde modelin koruma mekanizmaları tarafından engellenen siber güvenlik çalışmalarını kolaylaştırır. Zaten CVP'nin parçası olan işletmeler ve araştırmacılar, daha az güvenlik kısıtlamalarına sahip Opus 5 sürümüne anında erişebilirler.
Biyoloji. Opus 5 Opus 4.8 ile benzer bir koruma mekanizmaları paketine sahip olduğundan, artık bilimsel araştırma için en yetkin genel kullanım modelimizdir. Yine de model, uzun süreli otonom araştırma görevlerinde hala önemli sınırlamalar göstermektedir; burada AI modellerinin en önemli biyoloji ile ilgili riskleri oluşturmasını bekliyoruz. (Mythos 5 bu tür biyolojik çalışmalar için daha güçlü modeldir.) Bu başlatmanın bir parçası olarak, Fable 5'te engellenen biyoloji ile ilgili istekler artık Opus 4.8 yerine Opus 5'e yönlendirilecektir.
Claude Opus 5 bugün tüm platformlarda kullanılabilir; giriş Token başına 5 dolar ve çıkış Token başına 25 dolar (Opus 4.8 ile aynı). Geliştiriciler Claude API'de claude-opus-5 ile başlayabilirler.
Aynı zamanda Hızlı modda sunulmaktadır; burada varsayılan hızın yaklaşık 2,5 katı hızında çalışır. Opus 4.8'de olduğu gibi, Hızlı mod Claude Platform'da Opus 5'in temel fiyatının iki katında ve Claude Code'da kullanım kredileri aracılığıyla kullanılabilir.
Opus 5 ile birlikte, betada iki güncelleme yayınlıyoruz:
- Claude Platform'da sohbet ortasında araç değişiklikleri. Bir sohbet içinde, geliştiriciler artık Claude'un prompt önbelleğini geçersiz kılmadan kullanabileceği araçları değiştirebilirler.
- API'de otomatik geri dönüşler. Kullanıcılar artık Opus 5'teki (veya Fable 5'teki) güvenlik sınıflandırıcılarımız tarafından işaretlenen isteklerin otomatik olarak başka bir modele yönlendirilmesini seçebilirler. Otomatik geri dönüşler açık olduğunda, API istekleri engellenmek yerine varsayılan olarak her zaman mevcut en iyi modele yönlendirilir.
Önceki Opus modellerine uygun olarak, Opus 5'in genel erişim için veri saklama gereksinimleri yoktur.
Opus 5'ten en iyi sonuçları almak hakkında daha fazla rehberlik için prompting kılavuzumuza bakın.