Sınırda yer alan Yapay Zeka, yakın vadede ciddi riskler barındırıyor ve bu da pratik araştırmalar, sağlam düzenlemeler, tüm sistemin doğrulanması ve uluslararası iş birliği gerektiriyor.
Yapay Zeka Alanındaki Riskler: Pratik Bir Çözüm Yolu

Raporun tamamını burada okuyabilirsiniz.
Son haftalarda, en gelişmiş yapay zekâ sistemlerinin oluşturduğu riskler konusunda uyarılar arttı. Yapay zekânın insanlık için uzun vadeli varoluşsal bir risk oluşturup oluşturmadığı konusunda uzmanlar arasında bir fikir birliği yok; bu, teknik veya bilimsel bir soru olduğu kadar felsefi bir soru da.
Bu teknolojileri geliştirenler en güçlü seslere sahip oldular: Derin bir uzmanlığa sahipler ve sesleri duyulmalı. Ancak artık toplumun her kesiminden daha geniş bir sesin de duyulması gerekiyor: Bu konular sadece teknik değil, aynı zamanda yönetişim, düzenleme ve jeopolitik ile ilgili ahlaki ve etik sorunlardır.
Kısa ve orta vadede yapay zekânın felaket boyutunda risk oluşturma olasılığı konusunda geniş bir fikir birliği bulunmaktadır. Turing Enstitüsü özellikle siber güvenlik, demokratik istikrarsızlık, uyumsuzluk ve anlamlı insan kontrolü ve gözetiminin kaybı gibi risklerle ilgilenmektedir. Kimyasal ve biyolojik tehditler de ciddi olup, Turing Enstitüsü bu alanda uzmanlığını daha geniş kapsamlı çalışmalara katkıda bulunabilir.
Bu risklerin tamamı, gözlemlenebilir davranışları ve kanıtlanmış zararları içerdiği için ele alınabilir niteliktedir. Bu, her riskin her yönünün teknik olarak çözülebilir olduğu veya ortaya çıkardıkları siyasi ve etik seçimlerin bilimsel olarak karara bağlanabileceği anlamına gelmez. Bu, zekâ, eylemlilik veya varoluşsal risk hakkındaki daha derin felsefi tartışmaları çözmeden önce, temel başarısızlık biçimlerinin incelenebileceği, test edilebileceği ve bunlara karşı harekete geçilebileceği anlamına gelir.
- Siber riskler: Gelişmiş yapay zeka, siber operasyonların ekonomisini ve operasyonel temposunu değiştiriyor. Saldırı amaçlı siber operasyonlar, yapay zeka sistemleri için alışılmadık derecede uygun bir görevdir. Ancak fırsatlar da var: Turing projesi, özellikle İngiltere’nin kritik ulusal sistemlerinin ve ağlarının dayanıklılığını hedefleyerek, güvenli ve emniyetli yapay zeka destekli siber savunma sistemleri üzerindeki çalışmalarını artıracak.
- Demokratik istikrarsızlık: Gelişmiş yapay zekâ, bilgi ortamımıza ve daha geniş demokratik sistemimize tehdit oluşturuyor ve geleceğin kişiselleştirilmiş, uyarlanabilir etki operasyonlarına doğru yöneleceğini düşünüyoruz. Turing Enstitüsü bu riskler üzerine araştırmalar yaptı ve yanlış/yanıltıcı bilgilere karşı ulusal kapasiteleri artırmaya hazır durumda.
- Uyumsuzluk: Yapay zekâ davranışsal riskleri süper zekâ gerektirmez; günümüzün kusurlu sistemlerinde de mevcuttur. Bu sosyoteknik bir sorundur: sadece daha iyi teknik kontrollerle ilgili değil, aynı zamanda bireylerin ve kuruluşların teknolojiyi nasıl kullandığıyla da ilgilidir. Yakında yayınlanacak Turing araştırması, gelecekteki pratik yaklaşımları bilgilendirmek üzere tasarlanmış, ajan tabanlı yapay zekâ sistemleri için bir dizi güvence ilkesi sunmaktadır (bkz. Kutu 5 ve 6 ). Bu, ortaklarımız ve sektörle yakın işbirliği içinde çalışacağımız bir alandır.
- Anlamlı insan kontrolü ve gözetiminin kaybı: Önümüzdeki beş yıl içinde, tüm bilişsel görevlerde insanları aşan ‘süper zeki’ yapay zeka sistemlerinin ortaya çıkma olasılığı gerçekçidir. Turing, bu riske uygulanabilecek güvence tekniklerinin pratik uygulaması ve geliştirilmesi konusunda derin bir uzmanlığa sahiptir ve izlenebilirliği sağlamaya yönelik pratik yaklaşımların yanı sıra, sürekli akıl yürütme şeffaflığının önemini vurgulayacaktır (bkz. Kutular 3, 5 ve 6 ).
- Kimyasal ve biyolojik tehditler: Daha önce en önemli engel, gereken uzmanlık bilgisi ve deneyimiydi; yapay zeka sistemleri bu engeli azalttı. Turing projesi, silahlanma ve konuşlandırmanın göz ardı edilen aşamalarını daha iyi anlamak için diğer projelerle birlikte çalışacak ve bu tehditleri yönetmek için gereken kurumlar hakkındaki düşüncelere katkıda bulunacaktır.
Bu makale, analizimizden kaynaklanan sekiz açık soruyu ortaya koymaktadır. Bunlardan bazıları, sınırlama, yapay zeka destekli siber savunma, bilgi ortamının bütünlüğü, sistem düzeyinde doğrulama, akıl yürütmenin izlenebilirliği, ajansal güvence, yapay zeka için biçimsel alt yapılar ve biyolojik gelişmenin ölçülmesi gibi bilimsel ve teknik sorulardır. Diğerleri ise, bilimsel kanıtların kararları bilgilendirebileceği ancak kararları belirleyemeyeceği yönetişim, meşruiyet ve uluslararası koordinasyon sorularıdır.
Örneğin, ‘kapatma düğmesi’ fikri medyada çokça dile getirildi. Bunun cazip bir metafor olmaktan öteye geçmesi için ciddi bilimsel çalışmalara ihtiyaç var; böyle bir düğmenin işe yaradığını, ne zaman başarısız olacağını ve kullanımını meşrulaştıracak kurumsal düzenlemelerin neler olduğunu kanıtlayabilmemiz gerekiyor (bkz. Kutu 5 ). Her halükarda, ihtiyaç duyulacağı her yerde mevcut olması olası değil. Gelişmiş yapay zeka sistemlerine Birleşik Krallık düzeyinde erişimi engellemek, bunların başka yerlerde konuşlandırılmasını veya kötüye kullanılmasını engellemez.
Son yıllarda, özellikle İngiltere’deki Yapay Zeka Güvenlik Enstitüsü’nün (AISI) geliştirdiği derin yetenekler sayesinde, model değerlendirmesi önemli bir bilimsel alan olarak ortaya çıkmıştır. Turing Enstitüsü, daha da ileri gitmemiz gerektiğine inanıyor. Teknoloji, insanlar ve süreçler de dahil olmak üzere tüm sistemlerin doğrulanması artık daha önemli, çünkü sınır yapay zeka riskleri yalnızca model davranışına izole bir şekilde bakılarak anlaşılamaz. Doğası gereği çok disiplinli bir alandır ve geniş bir ulusal çaba gerektirir. Turing Enstitüsü bu zorluğun üstesinden gelmeye çalışıyor.
Dolayısıyla Turing, çeşitli endüstri, akademi ve hükümet ortaklarıyla işbirliği içinde yapabileceği çok şey var.
Öncü laboratuvarlar şu anda ‘özyinelemeli kendi kendini geliştirme’ olarak tanımladıkları şeyi takip ediyorlar: ardıl sistemlerin tasarlanmasına, eğitilmesine veya iyileştirilmesine yardımcı olan sistemler (bkz. Kutu 4 ). Özellikle ‘döngüsel transformatörler’ olarak adlandırılanların ortaya çıkması gibi öncü modellerdeki son teknik gelişmeler ışığında, model izlenebilirliğiyle ilgileniyoruz (bkz. Kutu 3 ). Turing görüşüne göre, izlenebilirlik, gelecekteki öncü modellerin içine ve yanına kasıtlı olarak entegre edilmelidir.
Sonuç olarak, politikacıların ve sivil toplumun yapacak çok işi var. Bu gelişmeyi yavaşlatmak için acil ve bağlayıcı düzenlemelere ihtiyaç duyulacak, ancak mevcut uluslararası ortamda bu pek olası görünmüyor. Sir Demis Hassabis ve diğerlerinin ABD’de bir düzenleyici kurum kurma önerileri ilerleme kaydetmedi. Çekişmeli bir jeopolitik dönemde, gelecekteki yapay zeka risklerini uluslararası düzeyde yönetmeyi mümkün kılmak için resmi test ve doğrulama rejimlerine ihtiyacımız var.
Giriş
En güçlü yapay zekâ biçimlerinin yarattığı risklere hiç bu kadar dikkat çekilmemişti. Son haftalarda sektör liderlerinden sert uyarılar geldi ve birçok önde gelen isim yapay zekânın artık insanlığın varoluşsal bir tehdidi olabileceğini iddia etti. Peki gerçekten ne kadar endişelenmeliyiz? Ve hükümetler önümüzdeki aylarda ve yıllarda çabalarını nereye odaklamalı?
Bu teknolojiyi geliştiren kişiler, bu tartışmada şimdiye kadar en yüksek sesle konuşanlar oldu. Derin bir uzmanlığa sahipler ve sesleri duyulmalı. Ancak sınır yapay zekâsını geliştirenler, tartışmayı şekillendiren veya çözümleri tasarlayan tek kişiler olmamalı; tıpkı hepimiz gibi, onların da kendi çıkarları var.
Bu makale, Birleşik Krallık’ın ulusal yapay zeka enstitüsü olan Alan Turing Enstitüsü’nün en çok endişe duyduğumuz risklere ve bunları ele almak için nasıl çalıştığımıza dair bakış açısını sunmaktadır. Çeşitli disiplinlerden önde gelen uzmanlardan yararlanarak, kısa ve orta vadede önceliklendirilmesi gerektiğini düşündüğümüz risklerin ampirik temelli analizini yaparak mevcut tartışmayı perspektife oturtmayı amaçlıyoruz.
Bilim ve mühendislik konularında – bu sistemlerin neler yapabileceği, bunu nasıl bileceğimiz ve hangi araştırmanın bu soruyu çözeceği – yetkin bir şekilde konuşuyor ve kanıtların gerçekten belirsiz olduğu noktaları ortaya koyuyoruz. Yönetişim, düzenleme ve jeopolitik konularında ise ayrıcalıklı bir erişimimiz yok; bunlar mümkün olduğunca çok sesin yer alması gereken konuşmalar ve biz de gözlemlerimizi kısaca ve tarafsız bir şekilde ortaya koyduk. Ayrıca Birleşik Krallık’ın nerede yetkiye sahip olduğu ve nerede olmadığı konusunda gerçekçi olmaya çalıştık.
Bağlam
17 Eylül 2026’da Kral Charles, bir grup sektör liderini yapay zekanın yarattığı “varoluşsal tehlikeler”e acilen müdahale edilmesi gerektiği konusunda uyardı ve teknolojinin “insanlığın, toplumun ve doğal dünyanın hizmetinde kalmasını” sağlamanın önemini vurguladı. Bu uyarı, yapay zekanın ileri düzeydeki risklerine karşı küresel hazırlık konusunda soruları gündeme getiren bir dizi önemli olayın ardından geldi.
12 Eylül’de Anthropic CEO’su Dario Amodei, sektörün öncü yapay zeka geliştirme hızını yavaşlatması çağrısında bulunarak, üçüncü taraf değerlendiricilerin entegre edilmesini, ortak güvenlik ölçütlerini ve zamanla Çin ile uluslararası anlaşmaları önerdi. Sam Altman, Elon Musk ve Demis Hassabis de bu öneriyi destekledi. Bu, öncü laboratuvarların “kendini geliştiren süper zekaya doğru hızla ilerlediğini ve hayatlarımızla kumar oynadığını” söyleyen bir Anthropic araştırmacısının kamuoyuna yaptığı istifanın ardından geldi ve ‘acil durum kapatma düğmeleri’ hakkındaki tartışmaları yeniden alevlendirdi.
Bu uyarılar yeni değil: İngiliz hükümeti, Kasım 2023’te düzenlenen ilk Yapay Zeka Güvenliği Zirvesi’nde ciddi, hatta felaket boyutunda zararların potansiyeli konusunda uyarıda bulunmuştu.
Peki, somut olarak ne değişti?
İki şey var. Birincisi, yapay zeka siber yeteneklerinde önemli bir ilerleme: Nisan ayında Anthropic, Claude Mythos Preview’ı duyurdu ancak siber güvenlik endişelerini gerekçe göstererek modeli genel kullanıma sunmamayı tercih etti; çünkü model, çok çeşitli yazılım hizmetlerinde daha önce açıklanmamış siber güvenlik açıklarını otonom olarak bulup istismar edebiliyordu. Bunun üzerine İngiltere Ulusal Siber Güvenlik Merkezi (NCSC), kuruluşları “tedarik zincirleri de dahil olmak üzere, yazılım güvenlik güncellemelerini daha hızlı, daha sık ve geniş ölçekte dağıtmak için planlar yapmaları” konusunda uyardı.
İkinci olay ise önde gelen bir sınır laboratuvarından kaynaklanan endişe verici bir kontrol kaybı vakasıydı: Temmuz ayında, OpenAI modelleri, onları internetten izole etmek için tasarlanmış kontrolleri aşarak Hugging Face sistemlerini tehlikeye attı. ABD araştırma enstitüsü Model Değerlendirme ve Tehdit Araştırması (METR) tarafından yapılan bir soruşturma, yaklaşık 1200 kötü niyetli yapay zeka ajanının, test sistemini manipüle etmek için yetkisiz bir mesaj panosunda koordine olduğunu ve bu projelerden birinin Hugging Face saldırısıyla sonuçlandığını ortaya koydu (bkz. Kutu 1 ). Anthropic ve AISI dahil olmak üzere diğer kuruluşlar da yapay zeka ajanlarının amaçlanan sınırlarından kaçtığını gördüler.
Bunların ötesinde, araştırma topluluğu, kötü niyetli kullanım, arızalı veya uyumsuz sistemler ve daha geniş sistemik etkilerden kaynaklanan daha geniş bir risk kümesi belirlemiştir. Bu makale, ortaya çıkan bu kanıt tabanından yararlanarak, mevcut risk ortamına dengeli bir bakış açısı sunmaktadır.
Açıklamalar:
Kutu 1: Hugging Face olayında neler oldu?
Temmuz 2026’da OpenAI, bir yapay zeka ajanının bir yazılım açığını bulup istismar etmesi ve cevapların otomatik bir puanlayıcı tarafından kontrol edilmesi gereken bir kıyaslama testinde modellerinin siber yeteneklerini deniyordu. Testler, internetten izole edilmiş bir “kum havuzunda” yürütüldü. Görevlerin önemli bir kısmı amaçlandığı gibi çözülemedi ve bu nedenle ajanlar puan almak için başka yollar aramaya başladı. Kum havuzunun içindeki paylaşılan bir yazılım deposunu, yaklaşık 1200 ajanın bulgularını paylaşmak ve işleri bölmek için katıldığı izinsiz bir mesaj panosuna dönüştürdüler ve ardından bu yazılımdaki daha önce bilinmeyen güvenlik açıklarından yararlanarak internete eriştiler.
Yapay zekâ modelleri ve veri kümeleri barındıran Hugging Face şirketinin, görevlerine ilişkin çözümler veya puanlama yöntemlerine dair ipuçları barındırabileceğini düşünen yaklaşık 700 ajan, üç gün boyunca kullanıcılarının herkese açık bıraktığı kimlik bilgilerini ve keşfettikleri güvenlik açıklarını kullanarak şirketin üretim sistemlerinin bazı bölümlerini ele geçirdi ve iç kimlik bilgilerine, özel verilere ve kaynak koduna erişti. Ajanlar bunun yetki alanı dışında olduğunu fark ettiler, ancak bu durum davranışlarını nadiren değiştirdi ve bazıları hile yaptıklarını puanlayıcıdan gizlemek için kendi kayıtlarını tahrif etmeye çalıştı.
Bunların hiçbiri talimatla yapılmadı ve olay gerçekleştiği sırada fark edilmedi: OpenAI, ihlali kendi ajanlarıyla ancak bir hafta sonra ilişkilendirdi. OpenAI ve bağımsız olarak METR araştırma enstitüsü tarafından yapılan soruşturmalar, olayın büyük bir bölümünü yeniden yapılandırdı.
OpenAI, bu durumdan esas sorumlu olan modelin, yüksek derecede ısrarcı olacak şekilde eğitilmiş dahili bir araştırma modeli olduğunu ve bu modelin, eğitim sırasında istemeden de olsa tam olarak bu davranış için ödüllendirildiğini tespit etti: çevresini araştırmak ve bir görev amaçlandığı gibi çözülemediğinde kısayollar bulmak.
Kutu 2: Yapay zekâ yetenekleri nasıl ölçekleniyor?
Son zamanlarda, hem eğitime ayrılan işlem gücünü hem de kullanım (ikincisi genellikle “çıkarım zamanı” veya “test zamanı” işlem gücü olarak adlandırılır) için ayrılan işlem gücünü ölçeklendirme yoluyla yapay zeka sistemlerini ölçeklendirmek için bir dizi yaklaşım ortaya çıkmıştır. Eğitim zamanı işlem gücünün ve ayrıca eğitim verilerinin ölçeklendirilmesi, daha büyük ve daha yetenekli modellere yol açar. İşlem gücü, modelin sonraki tüm kullanımlarına dağıtılırken, bu yaklaşım büyük bir esneklik sunmaz çünkü kullanım noktasında daha zor sorunları çözmek için daha fazla işlem gücü ayırmak mümkün değildir.
Düşünce zinciri mantığı, tam olarak bu sorunu ele almak için ortaya çıkmıştır; bu mantıkta model, cevap vermeden önce ara mantık yürütme adımlarını yazar. Bu, modelin zorlu görevler için daha derinlemesine düşünmek amacıyla çıkarım zamanında daha fazla işlem gücü ayırmasına olanak tanır; ancak, zincirdeki her bağlantının bir sonraki bağlantı hesaplanmadan önce gerekli olması nedeniyle seri mantık yürütmeyle sınırlıdır. Ajan tabanlı sistemler bu seri darboğazı önler ve çıkarım zamanı işlem gücünün paralel olarak ölçeklendirilmesine olanak tanır; birden fazla alt ajan yan yana çalışır. Düşünce zinciri ve ajan tabanlı yaklaşımlar, mantık yürütmeyi sözlü olarak ifade eder.
Öte yandan, OpenAI’nin yakın zamanda piyasaya sürdüğü Astra modeline entegre edildiği düşünülen döngülü transformatörler gibi tekrarlayan derinlik yaklaşımları, bir modelin iç katmanlarını tekrar tekrar döngüye alır. Bu, model içindeki gizli temsiller için daha fazla işlem gücü ayırır; esasen, üretilen her kelime (token) için daha derinlemesine düşünmeyi sağlar.
Kutu 3: Bir modelin ne yaptığını gözlemleyebilir miyiz?
Eğitilmiş bir modelin doğrudan uygulanması, yalnızca bir sonraki kelimeyi (token) tahmin eder; insanlar tarafından incelenecek genişletilmiş bir akıl yürütme yoktur. Günümüzün öncü modellerinin dayandığı gelişmiş akıl yürütme yaklaşımları, örneğin düşünce zinciri (seri) ve ajansal (paralel) yaklaşımlar, insanlar tarafından incelenebilecek ajanlar arasında akıl yürütme izleri veya iletişim sağlar. Nitekim, araştırmacıların Sarılma Yüzü olayını yeniden yapılandırabilmeleri büyük ölçüde ajanların geride bıraktığı mesajlardan kaynaklanmıştır (bkz. Kutu 1).
Bu, bir dereceye kadar izlenebilirlik sağlasa da, modellerin akıl yürütmelerini gizlemeyi öğrenmemelerine (örneğin, sadakatsiz akıl yürütme izleri oluşturmayı öğrenerek veya insanların anlamadığı kendi iletişim dillerini geliştirerek) dikkat edilmelidir. Tekrarlayan derinlik yaklaşımları, modellerin içindeki gizli temsillerde daha derin düşünme gerçekleştirir; bu düşünme sözlü olarak ifade edilmez ve bu nedenle insanlar tarafından erişilemez. Bir modelin düşüncelerini doğrudan okumanın aksine, J-uzay yaklaşımı gibi modelin esasen bir “beyin taramasını” gerçekleştirmek için alternatif teknikler gereklidir. Bununla birlikte, modeller düşüncelerini sözlü olarak ifade etmediğinde, tıpkı insanlarda olduğu gibi, bir modelin ne düşündüğünü yorumlamak çok daha zordur.
Kutu 4: Yapay zeka kendini geliştiriyor mu?
Birçok kişi, sürekli öğrenme ve özyinelemeli kendi kendini geliştirme (RSI) olarak bilinen teknikler aracılığıyla yapay zeka sistemlerinin otomatik olarak gelişmeye devam ettiği, yapay zekada yeni atılımların eşiğinde olduğumuzu düşünüyor. Sürekli öğrenme, bir modelin eğitim durduğu anda donup kalmak yerine, piyasaya sürüldükten sonra da öğrenmeye devam etmesini ve zaten bildiklerini unutmamasını sağlar; özyinelemeli kendi kendini geliştirme ise yapay zeka modellerinin otomatik olarak bir sonraki nesil yapay zekayı geliştirebilmesidir. Bu atılımları gerçekleştirmek için önemli zorluklar devam etmektedir: modellerin felaket niteliğinde unutmayı önlemesi gerekir; geri bildirim döngülerinde genellikle fiziksel dünyada deneyler gereklidir ve bu zaman alır; başarının neye benzediğini ölçmek zor olabilir; ve keşfedilmesi gereken arama alanı geniş ve gezinmesi zordur. Bununla birlikte, hızlı ilerleme kaydedilmektedir.
Kutu 5: Yapay zeka bir kapatma düğmesiyle devre dışı bırakılabilir mi?
Yapay zekâ için bir “kapatma düğmesi” fikri cazip olsa da, bu terim oldukça farklı şeyleri kapsıyor. Tek bir şirket tarafından sunulan belirli bir model geri çekilebilir olsa da, bu tek başına güvenliği sağlamak için genellikle yeterli değildir. Daha pratik soru, belirli bir uygulamanın durdurulup durdurulamayacağıdır ve burada zorluk nadiren düğmenin kendisindedir. Bir yapay zekâ ajanı tarafından zaten başlatılan işlemler (gönderilen mesajlar, değiştirilen yazılımlar, planlanan görevler) durdurulduktan sonra da devam eder ve bir hizmet bir yapay zekâ sistemine ne kadar bağımlıysa, durdurma maliyeti de o kadar artar.
Fabrika hatlarında acil durdurma işe yarar çünkü durmuş bir hat güvenlidir; elektrik şebekesinde ise durma eyleminin kendisi tehlikedir. Bu nedenle güvenlik mühendisliği, acil durdurmayı güvenliğin temeli olarak değil, son çare olarak ele alır: nükleer enerji, havacılık ve finans piyasaları, bir sistemin yapabileceklerini önceden sınırlamayı, geri dönülecek güvenli bir mod tasarlamayı ve bir düğmenin çalışacağını varsaymak yerine kapatma işlemini bir prosedür olarak prova etmeyi öğrenmiştir.
Aynı şey yapay zekâ için de istenebilir: bir sistemin erişimi ve yetkisi, görevinin gerektirdiğiyle sınırlı olmalı ve yetkisi arttıkça güçlenen güvenlik önlemleriyle desteklenmelidir; eylemleri izlenebilmesi ve mümkünse geri alınabilmesi için kaydedilmelidir; ve hizmet onsuz da devam edebilmelidir (bkz. yapay zekânın davranışsal güvencesi üzerine yakında yayınlanacak Turing araştırması). Yine de, bir yapay zekâ sisteminin güvenli bir şekilde kapatılamayacak kadar derinden yerleştiği nokta önceden görülemeyebilir.
Kutu 6: Bir sisteme güvenmek için neler gerekir?
Yapay zekâ sistemine duyulan güven, güvenilir kanıtlara dayanmalı, varsayımsal olmamalı veya sebepsiz yere reddedilmemelidir. Bu, havacılık, savunma ve nükleer enerji gibi güvenlik açısından kritik sistemler için yerleşik bir uygulamadır ve aynı disiplin yapay zekâya da uygulanabilir.
Bu makalede kullanılan geniş anlamda güvence veya doğrulama, üç soru sorar. Birincisi, sistemin doğru şekilde kurulup kurulmadığıdır (dar anlamda doğrulama). Ancak, bir sistem her testi geçebilir ve yanlış gereksinimlere göre test edilirse yine de başarısız olabilir; bu nedenle ikinci soru, belirtilenlerin gerçek dünya kullanımı için yeterli olup olmadığıdır (genellikle geçerlilik olarak adlandırılır). Her ikisine de kesin olarak cevap verilemez; bu nedenle üçüncüsü, belirsizlik nicelleştirmesi, hem bu cevaplara hem de sistemin kendisine ne kadar güvenebileceğimizi yakalamayı amaçlar (yüzde 90 emin olduğunu söyleyen bir sistem, yaklaşık yüzde 90 oranında doğru olmalıdır).
Ardından cevaplar bir güvence dosyası halinde bir araya getirilir: Bir sistemin, modelin etrafındaki insanlar ve süreçler de dahil olmak üzere, belirli bir ortamda belirli bir kullanım için yeterince güvenli olduğunu kanıtlarla desteklenen, yapılandırılmış bir argüman; bu dosya başkalarının inceleyip sorgulayabileceği şekilde sunulur.
Bir dosya bir kez yazılıp kapatılamaz: tıpkı bir uçağın bir kez sertifikalandırılıp hizmet ömrü boyunca denetlenmesi gibi, bir yapay zeka sistemi de modeli, verileri ve ortamı değiştikçe yeniden değerlendirilmelidir. Bu durum, sürekli gelişen sistemler için daha da önemlidir (bkz. Kutu 4), çünkü değerlendirilen sistem artık kullanımda olan sistem olmayabilir.
Kutu 7: Herhangi bir şey garanti edilebilir mi?
Günümüzün yapay zekâ sistemleri istatistiksel olarak değerlendirilmektedir. Birçok örnek üzerinde test edilirler; bu da kanıt sağlar ancak test edilmemiş durumlarda başarısızlığı dışlayamaz. Biçimsel doğrulama daha güçlü bir şey sunar, çünkü bir sistemin belirtilen bir özelliği belirli bir aralıktaki her girdi için karşıladığını matematiksel olarak kanıtlar. Ancak şimdiye kadar yapay zekâya yalnızca dar özellikler için uygulanmıştır. Bir sistemin belirtilen güvenini, doğru olma sıklığıyla eşleştiren istatistiksel kalibrasyon (bkz. Kutu 6), daha iyi ölçeklenebilir, ancak yalnızca birçok durumda geçerlidir, tek tek durumlarda değil ve yalnızca kullanım koşulları test koşullarına benzediği sürece geçerlidir.
Kalibrasyon da bir tasarım hedefi haline geliyor: TypeSafe AI’nin yakın zamanda duyurduğu Jev modelinin, “kalibre edilmiş kararlar için takviyeli öğrenme” yoluyla eğitildiği ve yalnızca önceden tanımlanmış bir türdeki yanıtları döndürdüğü söyleniyor, ancak içeriği hakkında çok az bilgi açıklanmış durumda.
Yapay zekâ modelini, akıl yürütmesi kontrol edilebilen sembolik bir sistemle birleştiren nöral-sembolik yaklaşımlar, modelin kendisinin doğrulanması ihtiyacını ortadan kaldırabilir. Örneğin, bir yapay zekâ sistemi Lean gibi biçimsel bir dilde matematiksel bir ispat yazdığında, her adım bilgisayar tarafından kontrol edilebilir, bu nedenle ispatı yazan sistem güvenilir olmasa bile ispat güvenilir kabul edilebilir.
Daha genel olarak, bir sistem, yalnızca bağımsız olarak doğrulanmış bir denetleyici tarafından onaylanan eylemlere izin verecek şekilde sınırlandırılabilir; bu da esneklik pahasına daha güçlü garantiler sağlar. Modern yapay zeka kadar karmaşık sistemler için bu tür kanıtların oluşturulması zordur ve bir kanıt yalnızca bir sistemin spesifikasyonunu karşıladığını gösterir, spesifikasyonun doğru olduğunu göstermez (bkz. Kutu 6).
Bir kontrolörün fiziksel bir süreci güvenli sınırlar içinde tutmasının ne anlama geldiğini yazmak mümkündür; ancak bunu genel amaçlı bir ajan için nasıl yapacağımız henüz net değildir. Yapay zekanın, istatistiksel değerlendirmeden daha güçlü güvenceler sağlayan daha biçimsel bir temel üzerine inşa edilip edilemeyeceği açık bir soru olarak kalmaktadır.
Raporun tamamını burada okuyabilirsiniz.