AI'ın kullanıcıların refahına etkisini daha iyi değerlendirmek için finansman
Anthropic, AI'ın kullanıcıların refahına nasıl etki ettiğini araştırmak için bağımsız araştırmaları finanse etmek amacıyla 5 milyon dolarlık bir hibe programı başlatıyor.
AI sistemlerinin kullanıcıların refahına etkisini araştırmak için bağımsız araştırmaları finanse etmek amacıyla 5 milyon dolarlık bir hibe programı başlatıyoruz. Program, AI endüstrisinin modellerimizin bu sistemleri kullanan kişileri nasıl etkilediğini ölçmesine yardımcı olan açık kaynak değerlendirmeler geliştiren hibe alanlarına doğrudan finansman, modellerimize erişim ve teknik destek sağlayacak. Hibe alanları tamamen bağımsız olarak çalışacak ve çalışmalarını herhangi bir geliştiricinin kullanabileceği açık kaynak projeleri olarak yayınlayacak.
Yapay zeka sistemleri birçok insanın çalışma, öğrenme ve sorun çözme biçiminin merkezinde yer almıştır. Aynı zamanda sohbet ortakları haline gelmiş ve zor zamanlarda duygusal destek kaynakları olabilmektedir. Ancak bir endüstri olarak, modellerimizin bu konuşmalarda nasıl davranması gerektiğine ilişkin açık standartlar geliştirme yolunda ilerlemekteyiz. Örneğin, bir kullanıcı bir modelden arkadaşlık aradığında veya ruh sağlığı krizi yaşarken yapay zekayı kullandığında bu konular ortaya çıkmaktadır.
Ayrıca, refahı değerlendirmek özellikle zor bir alandır. Çoğu model davranışı için, tek bir cevaba bakarak bunun doğru ve uygun olup olmadığını belirleyebiliriz. Ancak refahı değerlendirmek çok daha fazla bağlam gerektirir. Örneğin, sıkıntılı bir kullanıcı kendine zarar verme düşüncelerini hemen paylaşmayabilir; daha dikkatli bir yanıtın gerekliliği ancak uzun bir konuşma süresi içinde anlaşılır hale gelebilir. Ve bir bağlamda makul olabilecek bir yanıt, başka bir bağlamda zararlı olabilir. Örneğin, Claude, ağırlık vermek isteyen bir kullanıcıya dengeli beslenme ve egzersiz rutinleri hakkında tavsiye verebilir, ancak kullanıcı bozuk yeme davranışının bir geçmişini göstermişse, bu yanıt uygunsuz ve potansiyel olarak aktif şekilde zararlı olabilir.
Bu tür konuşmaları belirlemek ve Claude'un uygun şekilde yanıt vermesini sağlamak için önlemler geliştirmek üzere çalışmıyoruz. Ayrıca, Claude ile insanların yaptığı konuşma türleri hakkında araştırma yayınlıyoruz; bu da safeguard'larımızı nasıl geliştireceğimiz, onları nasıl değerlendireceğimiz ve kullanıcıların refahını korumak için alabileceğimiz diğer önlemler hakkında daha iyi bilgi sahibi olmamızı sağlamaktadır. Ancak bunlar çok nuanslı hususlardır ve tehlikeler önemlidir. Doğru yaklaşım, modellerimiz ve bunların kullanımlarının yanında gelişmeye devam etmesi gerekecektir.
Kullanıcı refahının bağımsız değerlendirmelerini ve kriterlerini oluşturmak için finansman sağlayarak, klinisyenler, psikologlar, metodologlar ve diğerleri de dahil olmak üzere daha fazla insanı bu gelişen ve kritik alana uzmanlıklarını katkıda bulunmaya davet etmek istiyoruz.
Daha etkili refahı değerlendirmelerine ve kriterlerine doğru
Bu programın bir parçası olarak, Safeguards ekibimizden bir refahı değerlendirmesinin üzerine inşa edilecek kadar titiz olmasını sağladığına inandığımız konular hakkında rehberlik sağlıyoruz ve ayrıca bir değerlendirmenin yararlılığını sınırlandırabilen yaygın zorlukları ortaya koymaktayız.
Kısaca, aşağıdaki özelliklere sahip değerlendirmeler arıyoruz:
- Ölçtükleri şeyi açıkça belirtmek (yani, neyin başarılı veya başarısız sayıldığı ve bunun neden önemli olduğu);
- Tasarım ve doğrulamada klinik ve konu uzmanlarını dahil etmek;
- Hem önlemleri hem de zararları test etmek (yani, hem aşırı uyum sağlama hem de aşırı reddetme riskini değerlendirmek);
- Kullanıcıların yapay zekayı nasıl gerçekten kullandığını yansıtmak (çoğu zaman bu, risk yükseldikçe ve bağlam uzun bir konuşma süresi içinde değiştikçe çok sıradüzey konuşmaları temsil eden senaryolar oluşturmak anlamına gelir);
- Değerlendiricilerini gerçek konu uzmanlarına karşı doğrulamak.
Hibe programı hakkında daha fazla bilgi edinmek ve başvurmak için başvuru formuna bakın. Güçlü refahı değerlendirmeleri ve kriterlerini oluşturma hakkında daha fazla bilgi için rehberliğimizi okuyun. Başvurular 21 Eylül'e kadar alınacak; tam teklif sunmak üzere seçilen başvuru sahipleri 5 Ekim'e kadar bilgilendirilecektir.