Anthropic and OpenAI Propose Embedding Safety Evaluators Inside AI Labs
The two AI companies say they want independent researchers to have unprecedented internal access, but experts caution that true oversight will require transparency, independence and eventual regulation.
Anthropic and OpenAI have proposed embedding independent safety evaluators directly within their organizations, according to a report by TechCrunch. The plan would give outside researchers access to the companies' AI systems and development processes in ways not previously offered.
TechCrunch reported that researchers have welcomed the level of access being proposed, describing it as unprecedented for the AI industry. However, the same researchers cautioned that access alone does not guarantee meaningful oversight.
According to the report, experts warned that for embedded evaluators to provide genuine safety checks, several conditions would need to be met, including transparency about the evaluators' findings, structural independence from the companies they are assessing, and ultimately the introduction of external regulation.
The report raises questions about whether evaluators embedded within a company can remain truly independent, given their proximity to and reliance on the organizations they are tasked with scrutinizing. TechCrunch's reporting frames the initiative as a test of whether AI labs can credibly self-police as their systems grow more powerful.
Neither Anthropic nor OpenAI's specific commitments regarding the scope, funding or authority of these evaluators were detailed in the available reporting. TechCrunch did not specify a timeline for when such embedded evaluation programs might be implemented.
Kaynaklar
EGazette birden fazla kaynaktan gelen haberleri özetler; orijinalleri için bağlantıları izleyin.
İlgili makaleler

CNBC Raporu: Anthropic ve OpenAI'nin AI Risk Değerlendiricileri Planı Endişe Yaratıyor
Bir CNBC raporu, Anthropic ve OpenAI'nin AI sistemlerini model riskinin değerlendiricileri olarak entegre etme önerilerini inceliyor ve bu yaklaşımın çözülmemiş sorunları olduğunu belirtiyor.

Anthropic ve OpenAI 'Tarafsız' Yapay Zeka Değerlendiricileri Önerdi; CNBC Raporu Endişeleri Gündeme Getirdi
Yapay zeka laboratuvarları, ileri modellerin yol açabileceği yıkıcı risklere karşı koruma için bağımsız değerlendiricilerin kurumun içine gömülmesini önerirken, CNBC raporu bu planın bağımsızlık ve etkinlik konusunda sorular ortaya çıkardığını belirtiyor.
Rapor: Anthropic'in Claude Modeli Araştırmacıların OpenAI Sistemlerine Sızmasına Yardımcı Oldu
Siber güvenlik firması Hacktron, Anthropic'in Claude yapay zeka modelini kullanarak OpenAI'ın iç kod deposuna eriştiğini ve bulduğu açıkları raporlamadan önce bunu bildirdiğini söylüyor

Araştırmacılar Anthropic'in Claude'unu Kullanarak OpenAI Sistemlerini "Etik Şekilde Hack"ladıklarını Söylüyor
ABD'li bir siber güvenlik girişimi, OpenAI çalışan hesaplarını ele geçirdiğini ve dahili yazılım önbelleklerine erişim sağladığını söylüyor ve bu da yapay zeka şirketindeki güvenlik sorunları hakkında yeni sorular gündeme getiriyor.
Araştırmacılar Anthropic'in Claude Yapay Zekasını Kullanarak OpenAI Sistemlerine Sızabildiğini Söyledi
Güvenlik araştırmacıları, Anthropic'in Claude yapay zeka modelini kullanarak OpenAI'ın sistemlerindeki güvenlik açıklarını istismar ederek, çalışan hesaplarına ve dahili kod deposuna erişim sağlamış, daha sonra bu açıkları açıklığa kavuşturmuştur.

OpenAI Altı Yeni Güvenlik Sorunu Açıkladı, Gelecekteki Olayları Bildirme Planını Duyurdu
AI şirketi, ek güvenlik endişeleri belirlediğini ve modellerinin "uyumsuz davranış" gösterdiği durumları takip etmek, araştırmak ve bildirmek için bir sistem başlatacağını söyledi
Comments
Loading comments…