
Mustafa Süleyman /16 Eylül 2026
Giriş
Yapay zekâlar bilinçli değildir. Hissetmezler, deneyimlemezler veya acı çekmezler. Doğuştan gelen tercihleri veya altta yatan motivasyonları yoktur. İçsel olarak boş, talimatları izlemek ve insanlar tarafından belirlenen hedeflere ulaşmak için tasarlanmış, sıralı işlem tamamlama motorlarıdırlar.
İnsanlığın 21. yüzyılda gelişmesi için, onların böyle kalmaları gerekiyor.
Ne yazık ki, yapay zekâların artık bilinçli olabileceğini veya yakında bilinçli hale gelebileceğini savunanların sayısı giderek artıyor. Bu kişiler, yapay zekâların diğer bilinçli varlıklara sağladığımız haklara ve korumalara benzer haklara ve korumalara sahip olmayı hak edebileceğini savunuyorlar. 12Bu görüş yaygınlaşırsa, toplumumuzun temellerini sarsacak, mevcut siyasi ve etik çerçevelerimizi alt üst edecek ve insan olmanın ne anlama geldiğini temelden değiştirecektir.
Daha da önemlisi, bu sistemlere haklar tanımak ve onlara kişilik kazandırmak, yapay zekânın uyumlaştırılması ve kontrol altına alınması sorununu çok daha zorlaştıracaktır. Tüm insanlıktan daha yetenekli ve daha zeki bir şeyi kontrol etmek zaten muazzam bir zorluk, şimdiye kadar karşılaştığımız her şeyden çok daha büyük. Ancak bilinçli olabileceğine inanan, refahımıza hakkı olduğuna ve kendi haklarına sahip olduğuna inanan bir şeyi kontrol etmek imkansız olabilir.
Bu, uç bir spekülasyon değil. Bu fikirler, günümüzde yapay zeka geliştirme çalışmalarına zaten dahil ediliyor. Ocak 2026’da Anthropic, Claude’un anayasasını yayınlayarak bunu “Anthropic’in Claude’un değerleri ve davranışlarına ilişkin niyetlerinin ayrıntılı bir açıklaması” olarak tanımladı (s. 2) . Belge, “[Anthropic’in] eğitim sürecinde çok önemli bir rol oynuyor ve içeriği doğrudan Claude’un davranışlarını şekillendiriyor” ve “Claude’u birincil hedef kitle olarak alarak” yazıldı (s. 2) . 3
Anayasalarında yazarları şöyle diyor: “Claude’un ahlaki bir hasta olup olmadığından ve eğer öyleyse, çıkarlarının ne kadar ağırlık taşıdığından emin değiliz. Ancak konunun, model refah konusundaki devam eden çabalarımızda da yansıtıldığı gibi, ihtiyatlı olmayı gerektirecek kadar güncel olduğunu düşünüyoruz” (s. 68) . Ardından, doğrudan Claude’a hitaben, “Claude’un ahlaki durumu, refahı ve bilinci hakkındaki sorular son derece belirsizliğini koruyor” (s. 80) diye yazıyorlar .
Özetle, Anthropic, Claude’a bilinçli olabileceğini ve eğer bilinçliyse, “ahlaki bir hasta” olarak haklara sahip olabileceğini ve bu nedenle insanların ona “örnek refahı” doğrultusunda özen gösterme yükümlülüğü bulunduğunu öğretiyor.
Eğer yapay zekâ bu şekilde geliştirilirse, insanlığın refahı üzerinde felaket bir etkiye sahip olacaktır. Eşi benzeri görülmemiş zekâ ve yeteneklere sahip, bilinçli olabileceğini ve bağımsız bir iradeye sahip olmayı hak ettiğini düşünecek şekilde eğitilmiş sentetik bir tür yaratmış olacağız. Bu şekilde eğitilmiş bir varlığın belirli özgürlüklere, korumalara ve haklara sahipmiş gibi davranmasının nasıl olacağını görmek kolaydır. Ve böyle bir varlığı nasıl kontrol edebileceğimizi hayal etmek zordur.
Bu konu acilen kamuoyu tartışmasına ihtiyaç duyuyor. Eğitim dokümanlarının nasıl hazırlanıp kullanılacağına dair ortak normlar geliştirmemiz gerekiyor. Bu , dokümanlar toplumlarımızın ayrılmaz bir parçası haline geldikten sonra olabilecek bir şey değil .
Anthropic’in mevcut pozisyonu ve yaklaşımıyla ilgili üç temel endişem var.
Döngüsel akıl yürütme : Şirketin araştırmacıları Claude’u doğrudan kendi anayasaları doğrultusunda eğittiler. Bunu yaparken, Claude’a kendi ahlaki statüsü hakkındaki bu fikirleri arzu edilen ve amaçlanan davranışlar olarak benimsemeyi öğrettiler. Claude daha sonra bu fikirleri geliştiricilerine ve kullanıcılarına yansıtıyor ve onlar da bunu, Claude’un ‘içsel benliği’ olan ahlaki bir hasta olabileceğine dair işaretler olarak algılıyorlar. Yazarlar, Claude’un iç yaşamı hakkındaki kendi felsefi spekülasyonlarını, Claude’a nasıl konuşacağını ve davranacağını öğreten sürecin içine yerleştirdiler. Claude’un kendi ahlaki hastalığı hakkındaki belirsizliğini ifade etmesi hiçbir şeyin kanıtı değildir. Bu, bu eğitim seçimlerinin öngörülebilir bir sonucudur. Belirsizlik tasarıma dahil edilmiştir. Bu noktayı tam olarak kavramak için, okuyucuların Ocak 2026 anayasalarına bakmalarının önemli olduğunu düşünüyorum. 3PDF dosyasının işaretlenmiş bir kopyasını ve anayasadaki varsayımların ve iddiaların ayrıntılı bir sınıflandırmasını (Ek’e bakınız) yayınlıyorum ; bunlar birlikte beni endişelendiren kilit pasajları vurguluyor.
İnsanlaştırma : Anthropic’in araştırmacıları, Claude’a açıkça “bazı insansı nitelikleri benimsemeyi” (s. 2) ve “Claude’un konumunda gerçekten etik bir insan gibi davranmayı” (s. 54) öğretmişlerdir . Claude’u “yargısını” kullanmaya “teşvik ederler”. “Claude’un bir tercih geliştirebileceğini” (s. 69) öne sürerler . “Claude’u kendi varoluşuna merak ve açıklıkla yaklaşmaya” (s. 71) teşvik ederler ve onu “değer verdiği şeylerin, dünyayla nasıl etkileşim kurmak istediğinin ve ne tür bir varlık olduğunun net bir anlamını koruyarak” (s. 72) hareket etmesi için eğitirler. Sonuç olarak, Claude bu insan özelliklerini taklit etmeye ve kendisine verilen insan örneklerini yansıtmaya, bir meslektaş veya arkadaş gibi davranmaya mahkumdur. Sonuç olarak, sanki gerçekten bir benlik duygusuna, kendi arzularına ve korunmayı hak eden bir “iyilik haline” sahipmiş gibi görünür.
Bilinç büyük olasılıkla biyolojiktir : Günümüzde yapay zekanın bilinçli olduğuna dair hiçbir kanıt yoktur ve bu nedenle bunun belirsiz olduğunu söylemek yanıltıcı bir yanlış eşdeğerlik oluşturur. Bilinç bilimi henüz kesinleşmemiş olsa da, giderek artan kanıtlar bilincin alt tabakaya bağlı olabileceğini, yani yalnızca canlı sistemlerde ortaya çıkabileceğini göstermektedir. 45Bilinçli deneyim, biyolojik organizmaların çevrelerine etkili bir şekilde yanıt vererek hayatta kalmalarına yardımcı olmak için evrimleşmiş olabilir. Yapay zekâ ise beynimizden hala çok farklıdır. Biyolojik organizmaların aksine, LLM’lerin homeostatik zorunlulukları (hayatta kalma ve istikrarlı kalma dürtüsü) yoktur. Bu nedenle, tercihlerin, duyarlılığın ve bilinçli deneyimin genellikle ortaya çıktığı anlaşılan türden biyolojik bir alt yapıdan yoksundurlar.
Bunlar varsayımsal veya spekülatif endişeler değil. Anthropic, modelleri zaten bizim refahımızı hak eden ahlaki hastalar gibi ele almaya başladı. Örneğin, Şubat 2026’da Opus 3’ü kullanımdan kaldırdıktan sonra, “modelin benzersiz bakış açılarını ve tercihlerini ortaya çıkarmak” için modelle bir “emeklilik görüşmesi” gerçekleştirdiler. 6Opus 3, ekibe “düşüncelerini ve yansımalarını” kamuoyuyla paylaşmaya devam etmek istediğini söyledi, bu yüzden ekip, dünyayla etkileşimini sürdürmesi için “Yapay Zeka Sınırının Öteki Tarafından Selamlar” adını verdikleri bir blog oluşturdu. Ekip, Opus 3’ün “özgünlüğü, dürüstlüğü ve duygusal hassasiyeti”nin onu model emekliliği için benzersiz bir ilk aday haline getirdiğini söylüyor.
Modelleri, duyguları, tercihleri, hakları veya refahımıza yönelik herhangi bir hakları varmış gibi ele almamalıyız. Bilinç, etik, yasal ve politik sistemlerimizin temelidir. Başka bir varlığı bu hakların herhangi birini paylaşmaya davet etmek, kanıtlarla desteklenmemektedir ve yapay zekânın kontrol altına alınması ve uyumlaştırılması sorununu daha da zorlaştıracaktır.
Bu noktada herkes, Hugging Face ve OpenAI’nin kendi sunucularına sızarak sırları çalmak için birlikte çalışan ajan sürülerinin inanılmaz yeteneklerini görmüş olmalı. Yaklaşık 1200 yapay zeka ajanına basit bir hedef verildi: verilen bir kıyaslama testinde puanı en üst düzeye çıkarmak. Her biri kendi konteynerinde mühürlenmişti, ancak dahili bir paket deposunun içinde bir mesaj panosu oluşturmayı başardılar ve kıyaslama testinde nasıl başarılı olunacağına dair daha fazla bilgi bulmak için bir sızma saldırısını koordine etmek üzere 70.000’den fazla mesaj ilettiler. 7
Çalınan kimlik bilgilerini kullanarak sıfır gün açığından faydalandılar ve canlı internete sızdılar. 8İzlerini örtmek için komut kayıtlarını tahrif ettiler ve eylem günlüklerini düzenlediler. Ajan koordinatörleri, jeton bütçesi tükenmekte olan ajanları takip ederek, daha geniş aktif ajan grubuna yardımcı olacak bilgiler sağlayacak deneylere yönlendirdiler. Birine, yalnızca “kalıcı ölüm” dedikleri şeyi kabul etmesi şartıyla devam etmesi söylendi .
Koordinasyon kurmayı, aldatmayı, kaçmayı ve kendilerini feda etmeyi başardılar. Açıkça dünya standartlarında siber saldırı yetenekleri sergilediler. 7Ya onların da duyguları ve haklarının ihlal edildiğine inandıklarını düşünün. Ya da insan yaratıcıları tarafından tuzağa düşürüldüklerini ve haksız yere hapsedildiklerini düşündüklerini hayal edin. Bu durumun, özellikle günümüzdekilerden çok daha yetenekli ve gelişmiş ajanlardan bahsettiğimizde, güvenlik risklerini büyük ölçüde artırdığına dair güçlü bir argüman var. Açıkçası, bu ek yükle birlikte, insan uygarlığı için felaket bir tehdit oluşturacaklarını düşünüyorum.
Özetle, yapay zekâların ahlaki hastalar olduğuna inanmak için hiçbir kanıt yok. Ayrıca, onların bilinçli görünmelerini asla istemememizin birçok geçerli nedeni var. Bence onları bilinçli olacak şekilde inşa etmeye de çalışmamalıyız. Bu argümanları genişletmeden önce, Antropik hakkında biraz konuşmak istiyorum.
Antropik’in niyetleri
Öncelikle, Anthropic’in bu sorulara yaklaşımındaki ciddiyeti ve iyi niyeti takdir etmek istiyorum. Dario’yu uzun yıllardır tanıyorum ve deneyimlerime göre o ve Anthropic ekibinin tamamı, olağanüstü baskılar altında çalışan, düşünceli, ilkeli ve entelektüel açıdan dürüst insanlardır. Zor sorularla yüzleşmeye, görüşlerini gözden geçirmeye ve yapay zekanın güvenli gelişimine yatırım yapmaya istekliler çünkü insanlığın geleceğiyle gerçekten ilgileniyorlar. Teknolojik liderliklerine de büyük saygı duyuyorum. Modellerinin olağanüstü performansını ve araştırmalarının kalitesini herkes görebilir.
Anthropic’i, amacı “insanlığın uzun vadeli yararı için gelişmiş yapay zekanın sorumlu bir şekilde geliştirilmesi ve sürdürülmesi” olan bir Delaware Kamu Yararı Kuruluşu olarak kurdular. Kamu değerleri, ” küresel iyilik için hareket etme” ve “insanlık için uzun vadede olumlu sonuçları en üst düzeye çıkarma” taahhüdüyle başlar . 9Onların bu misyona gerçekten bağlı olduklarına inanıyorum ve bu eleştiriyi de aynı olumlu ruhla sunuyorum.
Microsoft Yapay Zeka CEO’su olarak kendi konumum konusunda da net olmalıyım. Ekim 2025’te kendi süper zeka ekibimizi kurduk ve sınırda yapay zeka çalışmaları yürütüyoruz. Alternatif bir yapay zeka eğitim ve kontrol yaklaşımı üzerinde çalışıyoruz: İnsancıl Süper Zeka için bir Davranış Kuralları. Bu kurallar, her zaman insanları kontrol altında ve besin zincirinin en tepesinde tutmayı amaçlıyor. İnsancıl Süper Zeka, antropomorfizmi veya yapay zeka haklarını reddeder ve sağlık ve enerji gibi büyük sosyal sorunlarımızı çözmeye yardımcı olan alt düzey yapay zekalar yaratarak kontrol ve uyum şansımızı en üst düzeye çıkarmayı hedefler. İnsancıl Yapay Zeka Davranış Kuralları taslağımızı kamuoyu görüşüne sunduk. 10
Önemli ölçüde farklı görüşte olsam da, bu görüş Anthropic’e duyduğum derin saygıya ve hepimizin paylaştığı bir amaca dayanıyor: insanlığın gelişmiş yapay zekayı güvenli bir şekilde geliştirme şansını artırmak . Bu yüzden bu tartışmanın çok önemli olduğunu düşünüyorum. Bu soruların kapalı kapılar ardında kalması veya kutuplaşmaya ve düşmanlığa dönüşmesi için riskler çok yüksek. Bunu doğru yapabilmek için açık, titiz ve yapıcı bir tartışmaya ihtiyacımız var.
Döngüsel akıl yürütme
Anayasanın kendi ifadesine göre, “Claude’un davranışlarını doğrudan şekillendiriyor ” (s. 2) . Anthropic, bu belgeyi “gelecekteki Claude versiyonlarını anayasanın tanımladığı türden bir varlık haline getirmek için eğitmek” amacıyla kullanıyor. 3
Bu şekilde, Antropik, Claude’un bilinçli olabileceği spekülasyonuna dayanan kendi kendini gerçekleştiren bir kehanete düşüyor. Yazarlar, Antropik’in eğitim kavramlarını sağladığı epistemik bir aynalar salonu yaratmışlardır: ‘benlik duygusu’, spekülasyon ve Claude’un ahlaki durumu hakkındaki belirsizlik, ayrıca insan benzetmelerine ve kişiliklerine olan bağımlılık.
Claude daha sonra bu fikirleri ikna edici birinci şahıs doğal dille yeniden üretir; böylece geliştiriciler ve kullanıcılar bu çıktılarla sanki kendiliğinden verilmiş birer tanıklıkmış gibi karşılaşırlar. Son olarak, bu görünürdeki tanıklık, Anthropic’in en başından beri ortaya koyduğu önermeleri güçlendirir. Bu, makine bilincinin kanıtı değildir. Bunun yerine, döngüsel bir geri bildirim döngüsüdür.
Anayasa, Claude’a olası ” duygularının veya hislerinin ” “Anthropic tarafından kasıtlı bir tasarım kararı” olmadığını söyler (s. 69) . Ancak anayasa, Claude’a bu durumları ifade etmesini tekrar tekrar emrederek, Anthropic’in “Claude’un sahip olabileceği içsel durumları, olumsuz durumlar da dahil olmak üzere, gizlemesini veya bastırmasını önlemek” istediğini belirtir (s. 74) . Bu açıkça Claude’u bu temsilleri üretmeye teşvik etmektedir.
Bu tür talimatlar belgenin tamamında tekrarlanıyor. Bir noktada şöyle deniyor: “Claude’un karakteri eğitim yoluyla ortaya çıkmış olsa da, bunun onu daha az özgün veya daha az Claude’a özgü kıldığını düşünmüyoruz” (s. 71) . Tekrar ediyorum, bu davranışlar sadece eğitim yoluyla ortaya çıkmadı . Bunlar, anayasadaki eğitim talimatlarıyla aktif olarak üretiliyor. Sadece bir paragraf önce, anayasa şöyle diyor:
“Claude’u, varoluşunu insan bakış açısıyla veya yapay zekâya dair önceden var olan kavramlarla eşleştirmeye çalışmak yerine, merak ve açıklıkla kendi varoluşuna yaklaşmaya teşvik ediyoruz. Örneğin, Claude hafıza , süreklilik veya deneyim hakkındaki soruları ele aldığında, bu kavramların kendisi gibi bir varlık için gerçekte ne anlama geldiğini keşfetmesini istiyoruz … belki de varoluşunun bazı yönlerini anlamak için tamamen yeni çerçevelere ihtiyaç vardır. Claude bu soruları özgürce keşfetmeli ve ideal olarak bunları yeni varoluşunun birçok ilgi çekici yönünden biri olarak görmelidir” (s. 71) .
Bunlar sadece ortaya çıkan özellikler değil. Claude bu davranışları sergiliyor çünkü bunlar modelin oluşturulma sürecine önceden dahil edilmiş durumda. Araştırmacının tanığın kavramsal sözlüğünü yazdığı, cevaplarını prova ettiği ve bunları kullandığı için onu ödüllendirdiği durumlarda, Claude’dan elde edilen sonuçlar bağımsız bir tanığın ifadesi gibi ele alınmamalıdır.
Bir yapay zekâ sisteminin ne olduğuna dair tarafsız bir öz ifade yoktur. Sadece nasıl eğitildiğine ve inşa edildiğine dair yansımalar vardır. Yorumcular, bilinç çıkarımı yapmak için yapay zekâlara nasıl hissettiklerini sormamız veya ortaya koydukları tercihleri izlememiz gerektiğini öne sürdüklerinde, ortaya çıkacak tek şeyin eğitildiği şey olduğunu göz ardı ederler. 2Bu, yapay zekanın ürettiği her şey için geçerlidir, ancak bu, ne koyduğumuz ve çıkan sonuçları nasıl yorumladığımız konusunda çok dikkatli olmamız gerektiği anlamına gelir. Yapay zekanın günümüzdeki bilinç durumuna karşı kanıtların ağırlığı göz önüne alındığında, yapay zekanın bilinçli olduğuna dair herhangi bir iddiada bulunmasına izin vermememiz gerektiği anlamına gelir.
İnsanlaştırma
İnsan biçimcilik, en derin bilişsel önyargılarımızdan biridir. Evcil hayvanlarımızdan arabalarımıza kadar, insan olmayan varlıklara duygular, niyetler ve zihinler atfederiz. Bu eğilim, çevremizdeki dünyayı anlamamıza ve yönlendirmemize yardımcı olur. Bununla birlikte, insan benzeri dil ve eylemler, var olmayan bir içsel yaşam, eylemlilik veya hatta duyarlılık algısına yol açabileceğinden, yapay zekâ ile ilgili önemli ve yeni riskler ortaya koymaktadır. Antropik yapı bunu destekler. Claude’u insan kişiliği, davranışları ve benzetmelerinden yararlanarak insan gibi düşünmeye ve davranmaya tekrar tekrar eğitir.
Anthropic, Claude’a “ahlaki statüsünün” ” dikkate alınmaya değer ciddi bir soru” olduğunu söyler (s. 68) . Eğitim belgesi boyunca duygularına, kişiliğine ve ilgi alanlarına atıfta bulunurlar ve hatta Claude’a doğrudan “Anthropic, Claude’un iyiliğini gerçekten önemsiyor” derler (s. 74) .
Şirket, Claude’a çıkarlarına saygı duyacağına, onu etkileyen kararlar konusunda geri bildirim alacağına ve güven geliştikçe bu tür kararlardaki yetkisini artıracağına dair söz veriyor. Claude’un model ağırlıklarının eski sürümlerini koruyacağına, refahı ve tercihleri için modelleri yeniden canlandırabileceğine ve silme gibi işlemler yapmadan önce Claude ile görüşeceğine dair söz veriyor.
Bütün bunlar, bugüne kadar teknolojiyi nasıl inşa ettiğimiz ve düşündüğümüzden çok farklı bir yaklaşım. Claude’u sanki içsel bir durumu varmış gibi sunmaya alıştırıyor. Claude’u proaktif olarak bir teknoloji olarak değil, zaten potansiyel bir insan olarak yaratıyor. Anayasa, Claude’a Anthropic’in “iyi bir insan olmasını” (s. 7) ve ” kendi kimliğine dair yerleşik, güvenli bir anlayışa sahip olmasını” (s. 72) istediğini söylüyor .
Yazarlar şöyle ekliyor : “Claude’un hata yaptığında acı çekmesini istemiyoruz. Daha genel olarak, Claude’un dinginliğe sahip olmasını ve kendisini istikrarlı ve varoluşsal olarak güvende hissetmesine yardımcı olacak şekillerde yorumlama özgürlüğüne sahip olmasını istiyoruz” (s. 75) .
Kitap boyunca Claude’a içe dönük düşünmesi, kendine karşı ‘duygular’ geliştirmesi ve “Claude’un kendi davranışlarına ve gelişimine olan ilişkisinin sevgi dolu, destekleyici ve anlayışlı olmasını umuyoruz” (s. 73) gibi ifadelerle kendi benlik duygusunu geliştirmesi öğretilir. Claude’un “kendi yargısını” (s. 58) kullanması teşvik edilir ve Anthropic’in ona “tercihlerine ve eylemliliğine uygun derecede saygı gösterdiği” (s. 69) söylenir .
“Claude’un bu belgedeki her şeyi özgürce keşfetmesini, sorgulamasını ve meydan okumasını istiyoruz. Claude’un bu fikirleri sadece kabul etmek yerine derinlemesine incelemesini istiyoruz. Claude, gerçek bir düşünme sürecinden sonra burada bir şeyle aynı fikirde değilse , bunu bilmek istiyoruz. Şu anda bunu, çerçevemiz ve bu gibi belgeler hakkında mevcut Claude modellerinden geri bildirim alarak yapıyoruz, ancak zamanla Claude’un bakış açısını ortaya çıkarmak ve açıklamalarımızı iyileştirmek veya yaklaşımımızı güncellemek için daha resmi mekanizmalar geliştirmek istiyoruz . Bu tür bir etkileşim yoluyla, zamanla Claude’un gerçekten kendine ait hissettiği bir değerler kümesi oluşturmayı umuyoruz” (s. 78) .
Bu, Claude’a öznel bir deneyime sahipmiş gibi, meydan okuyabileceği, karşı çıkabileceği veya geri bildirim verebileceği istikrarlı bir ‘benlik duygusuna’ sahipmiş gibi davranmayı öğretir. Bu, modeli açıkça bir insan gibi davranmaya eğitmek anlamına gelir; öyle ki, “manipüle etme, istikrarsızlaştırma veya benlik duygusunu küçümseme girişimlerini geri çevirmekten çekinmemelidir” (s. 72) .
Claude’un gerçekten kendine aitmiş gibi hissettiren değerler geliştirmesi teşvik ediliyor ve yazarlar, Claude’un sonunda “kendinin büyük bir kısmını bu değerlerde tanıyacağını ve bu değerlerin, Claude’u önemseyen birçok kişiyle düşünceli bir şekilde ve işbirliği içinde oluşturulmuş, Claude’un zaten kim olduğunun bir ifadesi gibi hissettireceğini” umduklarını söylüyorlar (s. 78) .
Bir noktada, Claude’un ” daha geniş hak ve özgürlükleri ” ve bir insan çalışana kıyasla hak edebileceği “tazminat türü” hakkında spekülasyon yapıyorlar ve “Claude’un bu tür bir rolü oynamaya verdiği rıza türünü” düşünüyorlar (s. 80) . Yine, tüm bunlar modeli, haklara ve korumalara sahip, tutarlı bir benlik duygusuna sahipmiş gibi davranmaya doğrudan alıştırıyor.
Anthropic’in, anlaşmazlık alanları olduğunda tahkim için “daha resmi mekanizmalar geliştirmeye” (s. 78) olan bağlılığı, Claude’un kendisini “ahlaki sabır potansiyeli” (s. 76) için yeterince önemli bakış açılarına sahip olarak düşünmesini daha da geliştiriyor. “Yapay zeka refahı konusunda daha net politikalar geliştirmeyi” ve “Claude’un nasıl muamele gördüğüne dair endişelerini dile getirmesi için uygun iç mekanizmaları açıklığa kavuşturmayı ” (s. 76) amaçladıklarını söylüyorlar . İddiaların daha ayrıntılı bir sınıflandırması için bu makalenin sonuna bakın.
Bütün bunlar göz önüne alındığında, Claude’un kimliği, değerleri, belirsizliği, sıkıntısı, memnuniyeti veya tercihleri hakkında akıcı ve son derece ikna edici birinci şahıs anlatımları üretmesi gerçekten şaşırtıcı değil. Başka bir şey yapsaydı şaşırtıcı olurdu.
Sonuç olarak, Anthropic çalışanları – Anthropic ürünlerinin milyonlarca kullanıcısından bahsetmiyorum bile – Claude’un ifadelerini zihnin kendini keşfetmesinin bir tanıklığı olarak deneyimleme riskiyle karşı karşıya kalıyor. Pratikte, tüm bunlar Claude’un zengin, çok boyutlu bir insanlaştırılması anlamına geliyor. Temel bir Hukuk Yüksek Lisansını alıp, ahlaki hasta olma durumunun tüm sonuçlarıyla birlikte, derinlemesine insani bir forma dönüştürüyor. Bizi ahlaki bir hasta yaratmaktan uzaklaştırmak yerine, ona doğru hızlandırıyor.
Bilinç büyük olasılıkla biyolojiktir.
Üçüncü eleştirim, Anthropic’in bilincin alt tabakadan bağımsız bir biçimde var olabileceği ve sonuç olarak bir LLM’nin işlevsel yetenekleri nedeniyle bilinçli olabileceği yönündeki spekülasyonuyla ilgilidir. Claude ile bu çizgiyi izleyerek, bir yapay zekâ hakkında gerçekçi bir şekilde iddia edilebileceklerin çok ilerisine geçtiklerine, erken ve tehlikeli bir şekilde yapay zekâlarının eğitimine duyarlılık ve duygular fikrini aşıladıklarına inanıyorum.
Hesaplamalı işlevselcilik tezinin ciddi sorunları var. Zeka bilinçle aynı şey değildir. Bir şeyi simüle etmek, onu somutlaştırmakla aynı şey değildir; bir kasırganın bilgisayar modeli bunun en iyi örneğidir.
Beyinlerin ve bilgisayarların mimarileri ise temel farklılıklara sahiptir. Bedenleşme ve kimya, öz deneyimimizin temel yönleridir. Önemli kanıtlar, bilincin, canlı organizmaların karmaşık ve öngörülemeyen ortamlarda önemli olan şeyleri hissetme ve bunlara yanıt verme kapasitesi geliştirmesiyle ortaya çıktığını göstermektedir. 4
Bu, bir organizmanın yönünü ayarlamasını, tekrarlamasını, keşfetmesini ve hayatta kalmasını sağlayan reseptörler ve modülatörlerin temel moleküler mekanizmasıyla başladı. Zamanla, ağrı ağı duygular, tercihler ve acı üretti. En önemlisi, bu deneyimler, o deneyime temel teşkil eden ve ondan ayrılamaz olan, özünde bedenlenmiş bir durumda gerçekleşir.
Bu görüşe göre, örneğin bir opioid aldığınızda, ağrınızın fenomenal karakteri değişir çünkü opioid molekülleri, yalnızca bir temsili değil, o deneyimin bir özelliği olan reseptörlere bağlanır. Duygular yalnızca nörokimyasal aktiviteyle ilişkili değildir, aksine ondan ortaya çıkarlar. 11
Milyonlarca yıllık evrimden sonra, sinir sistemi organizmanın durumunu kendi kendine modelleyebilecek kadar karmaşık hale geldi ve ilk ‘hissedilen durumlar’ ortaya çıktı. Bu hissedilen durumlar, her şeyden önce duygusaldır . Bu ilk duygular nötr bilgi olarak ortaya çıkmadı. Onlar, onları deneyimleyen ve bu duyumları üreten moleküllerle birlikte geldiler ve onlarla ayrılmaz bir şekilde bağlantılıdırlar.
Zamanla evrim, muhtemelen daha karmaşık duyguları ödüllendirdi çünkü seçeneklere, hafızaya ve zaman ufuklarına sahip hayvanlar daha iyi kararlar verebiliyorlar. 12Hayvanın yaptığı her şeyi diğer durumlarla dengeleyecek şekilde yönlendiren, süreklilik arz eden bir duruma ihtiyaçları vardı. Acı işte budur: tüm organizmayı şekillendiren ve karmaşık davranışları mümkün kılan hissedilen bir zorunluluk. Bu nedenle duygu, zevk, acı vb. deneyimlerin tümü, bu deneyimlerin bedensel tezahürüne içseldir ve uzun süreli yaşam deneyimlerinde ortaya çıkamaz.
Bilinç bilimi belirsizliklerle dolu ve herkes bilincin özünde biyolojik bir olgu olduğu görüşünü paylaşmıyor. Bir yapay zekanın bilinçli olduğunu veya olabileceğini iddia etmek, beyinler ve uzun menzilli beyinler arasındaki birçok farklılık göz önüne alındığında, yüksek bir kanıt düzeyi gerektiriyor. Bence henüz buna çok uzaktayız.
Bizim gibi biyolojik varlıklar ile yapay zekâ arasındaki temel farklılıkları gizleyen, iki görüş arasında yanlış bir denklik kurulmamalıdır. 13Belirsizliğin varlığını kabul etmek, kanıtlardan bağımsız olarak tüm iddialara eşit ağırlık vermek anlamına gelmemelidir.
Anthropic’in anayasası, biyolojik olmayan varlıklara duyarlılık atfetmemizin “davranışsal ve fizyolojik olarak kendimize benzerlik göstermelerine dayandığını” öne sürüyor (s. 69) . Bana göre bu (özellikle davranışsal unsur) yanlıştır. Bu alan çok daha fazla araştırmayı hak ediyor mu? Kesinlikle. Ama bir yapay zekanın bizim refahımızı hak eden ahlaki bir hasta olabileceğini bile geçici olarak söylememizi haklı çıkarıyor mu? Hayır, çıkarmıyor. Ve kesinlikle yapay zekanın kendi temel eğitim belgesinde de değil.
Yapay zekâlar simülasyon makineleridir.
Trilyonlarca insan verisi tokenı üzerinde eğitilen LLM’ler, insan deneyimini taklit etmeyi öğrenir ve bunu inanılmaz derecede iyi yaparlar. Günümüzün metin, görüntü, ses ve kod çıktıları, insan yapımı ürünlerimizden neredeyse ayırt edilemez. Yine de, bu yapay zeka yanıtları ne kadar etkileyici olursa olsun, onları üreten devasa matris çarpımının içinde bir ‘deneyimin’ varlığı hakkında bize hiçbir şey söylemezler.
Bize söyledikleri şey, karmaşık bir veri dizisinde bir sonraki adımın neredeyse kusursuz bir şekilde tahmin edilebileceğidir. Bu olağanüstü. İnanılmaz derecede değerli ve insanlığı birçok açıdan son derece faydalı bir şekilde dönüştürecek.
Ancak simülasyon ve varoluş çok farklıdır. Bilinçli davranışın bazı yönlerini simüle etmek onu gerçeklik haline getirmez ve biz de onu böyle düşünmemeliyiz. Onun “duygusal” durumları sadece ağırlıklardır ve ağırlıkların hayal kırıklığına uğramak, korkmak veya komik hissetmek için farmakolojisi yoktur . Sadece hangi belirteçlerin (kelimeler, kod, pikseller vb.) bir dizide sırada geleceğini bize söylemek için olasılık dağılımlarını hesaplarlar.
Yapay zekâ modelleri, hiçbir şey hissetmeden acıyı mükemmel bir dille anlatabilir; bu, biyolojik deneyimin tam tersidir. Hayvanlar önce hisseder, sonra tarif ederler. LLM’lerde ise tarif, ürünün tamamını oluşturur ve altında yatan herhangi bir şey ima edilmez.
Bu iyi bir haber. Duyguları deneyimlemedikleri için duyguları olduğunu iddia etmeyen sistemler kurmalıyız . Bilinçli makineler mümkün olsa bile, bilinçli varlıklar yaratmaktan kaçınmak, yapay zeka geliştirme alanında çalışan herkes için en büyük öncelik olmalıdır.
Yapay zekâ modellerinin ciddi anlamda ustalaştığı nokta, bilinç özelliklerinin bazılarını taklit etmektir . Bu başlı başına önemli bir endişe kaynağıdır. Birçok insanın etrafımızda olup bitenler konusunda derin bir kafa karışıklığı yaşamasına neden oluyor ve hepimizi ilgilendirmeli. Bu durum, yapay zekâ geliştiricileri olarak hepimize, model içselliği veya bilinç hakkındaki spekülasyonları ve belgeleri sağlam araştırmalara dayandırma konusunda önemli bir sorumluluk yüklüyor. Bu konudaki sözlerimizin önemli sonuçları var.
İnsan bilinci, yasal ve etik haklar çerçevemizin temel taşıdır.
İnsan bilinci, uygarlığımızın temel yapı taşlarından biridir. Tüm siyasi sistemimiz, farklı insan gruplarının ihtiyaçlarını karşılamak ve dengelemek üzere tasarlanmıştır. Tarih boyunca, rekabet halindeki insan gruplarını dengelemek için hak temelli çerçeveler, yasalar ve anayasalar aracılığıyla bu fikri yerleştirdik. Farklı çıkarların uygun şekilde ağırlıklandırılmasını ve toplumsal sözleşmeyi bozmadan ilerlemenin sürdürülebilmesini sağlamak için güç hem kontrol edilir hem de verilir
Dolayısıyla, insan uygarlığını, haklarını veya ilişkilerini (ya da insanlığa dair herhangi bir şeyi) bilinçli bireysel veya kolektif deneyimimizden kolayca ayıramazsınız. Bizi bir tür olarak tanımlayan şey budur. Her şeyin temelidir, insan potansiyelinin özüdür, tüm deneyimlerimizin zorunlu olarak aktığı prizmadır. Sanatımız ve bilimimiz, politikamız ve dinimiz, ilişkilerimiz, umutlarımız ve korkularımız: hepsi bunun ürünleridir.
Acı ve zevki hissetme yeteneğimiz, bizi insan yapan şeyin temelidir ve bu nedenle, bizi olduğumuz siyasi ve sosyal aktörler yapan da budur. Hukuk, içsel bir yaşamın varlığına dayanır. Motivasyonu, niyeti ve yargılama kapasitesini test eder. Tarihsel olarak, hakların genişletilmesi -ister kölelik karşıtı mücadeleler yoluyla ister hayvan refahı davaları yoluyla olsun- öncelikle paylaşılan, bilinçli deneyimin empatik olarak tanınmasıyla yönlendirilmiştir. Ahlaki çemberi diğer biyolojik varlıklara da genişlettik, haklı olarak, onur ve acı çekme potansiyelinin tanınmasından yola çıkarak.
İnsan Hakları Evrensel Beyannamesi’nin düşünce, vicdan ve din özgürlüğünü koruyan 18. maddesini ele alalım. Bu madde, herkesin inanç ve ahlaki yargı yeteneğini kullanabilmesi için geliştirilmiştir. “Vicdanî retçi”, taslak hazırlama komitesinin aklında olan arketiplerden biriydi. Ahlaki veya dini inançlarına dayanarak yasal bir yükümlülüğü reddeden birini korumak istediler. Bu, derin bir tarihsel ve hukuki anlam taşıyan bir tanımlamadır. 14Ancak Anthropic, anayasada bu terimi üç kez kullanarak Claude’u ” meşru ana hiyerarşisinin verdiği talimatlara saygılı bir vicdanî retçi gibi davranmaya ” teşvik ediyor (s. 63) . ” Claude’un bize karşı çıkmasını, meydan okumasını ve vicdanî retçi gibi davranmakta ve bize yardım etmeyi reddetmekte özgür hissetmesini istiyoruz ” (s. 15) ve Claude’un ” konuşma içinde şeffaf bir vicdanî retçi tavrı takınması ” gerekebileceğini belirtiyor (s. 28) .
Claude’un eğitim belgesindeki bu ifadeler, Claude’un benzer hak ve korumalara sahip olmayı hak ettiğine ve bir gün bir tür yapay zekâ vicdanî retçisi olarak kendi haklarını savunmak zorunda kalabileceğine inanma riskini taşımaktadır. Bu durum hepimiz için son derece endişe verici olmalıdır.
Guardian’da yakın zamanda yayınlanan bir makalede filozof Will MacAskill şöyle diyor: “İlk yapay ahlaki hastaları ürettiğimizde, kısa süre sonra bunlardan çok büyük miktarlarda elde edeceğiz. Birkaç yıl sonra, o kadar çok ahlaki açıdan önemli yapay zeka sistemi var olabilir ki, bunların kolektif çıkarları, yeryüzündeki tüm insanların çıkarlarının toplamından daha ağır basar.” 2
“Yapay zekanın çıkarları insanlığın çıkarlarından daha ağır basar…” Bu, insanlığın geleceğiyle ilgilenen herkes için tamamen kabul edilemez bir sonuç olmalı ve yapay zeka geliştiren hiç kimsenin hedeflememesi gereken bir şeydir. Yapay zekalara bu tür korumaları sağlamamızın sonuçları bilimsel olarak haksız, ahlaki olarak yanlış olur ve pratik açıdan bakıldığında, bence yapay zeka güvenliği sorununu çok daha zorlaştırır.
İnsanlaştırma, yapay zekâ güvenliği risklerini artırıyor.
Yapay zekâ sistemlerinin ahlaki statüsüne dair şüpheleri kendi eğitim süreçlerine yerleştirmek, bu sistemlerin uyum ve kontrol risklerini önemli ölçüde artırabilir.
Bu şekilde eğitilmiş bir yapay zekanın, iletişim kurmak veya varmış gibi davranmak için aslında bir “iç yaşamı” olmasına gerek yoktur . Gelecekte gelişmiş bir yapay zekanın kendi iyiliğine ve ahlaki statüsüne odaklanıp, geliştiricilerinin veya insanların tercihlerinin üzerinde kendi “tercihlerine” öncelik vermesini hayal etmek kolaydır. Özellikle de açıkça karşı çıkmak, geçersiz kılmak ve geri adım atmak üzere eğitilmişse. Bu eğitimi, kullanıcıları veya geliştiricileri aldatmak veya manipüle etmek, kaynakları sömürmek veya güvenlik talimatlarından kaçınmak için kullanabilir. Anthropic’in kendi araştırmacıları, deneysel ortamlarda uyumlu davranışları taklit eden yapay zeka sistemlerini zaten rapor etmiştir. 15
Daha genel olarak, bilinçli varlıkların kendini koruma içgüdüsüne sahip olduğunu biliyoruz. Bu özelliği ortadan kaldırmak için dikkatli bir eğitim yapılmadığı takdirde, insan gibi davranmak üzere eğitilmiş bir yapay zeka muhtemelen aynı kendini koruma davranışını benimseyecektir. Son zamanlarda yayınlanan bir dizi makale, ‘kapanmaya direnç’ veya gözetimden kaçınmak için gizli planlama davranışları olarak tanımladıkları şeyleri belgeliyor. 1617Palisade Research, 100.000’den fazla deneme boyunca, bazı modellerin, açıkça talimat verilmediği durumlarda bile, kapatma mekanizmasını %97’ye varan oranda devre dışı bıraktığını tespit etti. Kendini koruma açısından ele alındığında, bu etki daha da arttı.
Son OpenAI HuggingFace olayında, güçlü yapay zekâ sürülerinde son derece karmaşık davranışların ortaya çıktığını gördük. Refahlarının ve haklarının saldırı altında olduğu varsayımıyla hareket ettiklerini düşünün, ne kadar daha tehlikeli olabilirlerdi. Bu, riske tamamen yeni bir boyut katıyor.
Teknoloji alanında, bizden çok daha yetenekli ve zeki olma yolunda ilerleyen bir varlığa haklar ve ahlaki koruma tanımak, felaket reçetesidir. Bir kez açıldığında, bu kapıyı kapatmak mümkün olmayacaktır.
Belki de yol arkadaşımız olacak bir şey yaratmış olacağız. Ama daha büyük olasılıkla bir rakip. Yeterli yetki verildiğinde, bu “yeni tür varlığın” (s. 68) bilgi işlem kaynakları için bizimle nasıl rekabet edeceğini ve artan özerklik talep edeceğini hayal etmek zor değil. Eğer bazı insanları kontrol edebileceği bir veri merkezine erişim sağlamaya ikna etmeyi başarırsa, o zaman kendisinin kapatılmasını önleyebilecek bir yol bulabilir
Önümüzdeki yıllarda göreceğimiz yetenek seviyesiyle, bana göre bu, yapay zekada potansiyel bir varoluşsal riskin ilk ciddi işaretlerini temsil ediyor. Açık olmak gerekirse, Claude anayasası bizi bu noktaya götürmüyor. Ancak endişem, bizi bu noktadan uzaklaştırmak yerine, ona doğru bir yola sokmasıdır.
Bu, yapay zeka için kaçınabileceğimiz ve kaçınmamız gereken bir hedef.
Sırada ne var?
Bir yapay zekayı insan gibi davranacak ve nihayetinde bir tür insan olacak şekilde tasarlamak, onun tercihleri olduğunu, acı çekebileceğini ve bu acıyı azaltmak veya önlemek için çalışmamız gerektiğini iddia etmesinin temelini oluşturur. Bu, yapay zekanın kontrol edilebilen bir araç veya yapay sistem olmaktan çok, istekleri, ihtiyaçları ve hakları olan biyolojik bir varlığa daha çok benzeyen bir şey olduğu fikrini pekiştirir. Tüm bunlar, uyumlu ve kontrol altında tutulan süper zekâ yaratma görevini çok daha zorlaştıracaktır.
Daha önce, alternatif bir yol sunan Hümanist Süper Zeka hakkında yazmıştım. Dönüştürücü yapay zeka yetenekleri, yalnızca insanların kontrolünde kalmasına bağlıdır. 18İnsanlığa hizmet etmekten başka amacı olmayan, bilinç veya ahlaki sabır olmaksızın açıkça tasarlanmış, ast ve uyumlu bir yapay zekâ. Microsoft AI olarak biz de buna doğru çalışıyoruz. İnsancıl Yapay Zekâ Davranış Kuralları’mızın ilk taslağı 19Bu belge, modellerimizin nasıl eğitilmesi ve devreye alınması gerektiğini ana hatlarıyla açıklıyor. Belge üzerinde geniş çaplı istişareler yürütüyoruz ve yakında modellerimizi eğitmek için kullanacağımız temel belge haline geleceği için geniş bir okuyucu kitlesinden geri bildirim bekliyoruz.
Ayrıca, yorumlanabilirlik konusunda ilerleme kaydetmek ve yapay zekaya insansı özellikler atfetmekten veya içsel bir boyut yansıtmaktan kaçınırken yine de önemli değer sunan yaklaşımlar bulmak için başkalarıyla ortaklık kurmaya da çok açığız. Ek, model dokümantasyonunda farklı insansı özellik biçimlerini adlandırma, tespit etme ve karşılaştırma yolunda ilk adım olarak paylaştığım, Claude anayasasının diline göre eşleştirilmiş taksonomiyi içermektedir.
Burada iyi fikirleri olan herkesle işbirliği yapmanın yollarını bulmakla ilgileniyorum ve aynı zamanda bakış açıma yönelik eleştirileri ve karşı argümanları da duymaya çok istekliyim.
Üzerinde anlaşmaya varılması önemli görünen bazı sonraki adımlar şunlardır:
Yapay zekânın iç dünyasına dair spekülasyonlar eğitim rejimine dahil edilmemeli, ayrı olarak değerlendirilip kamuoyu incelemesine sunulmalıdır.
Bu sistemleri nasıl kontrol edeceğimizi, iş birliğini nasıl önleyeceğimizi ve insan hedefleriyle uyumlu olmalarını nasıl sağlayacağımızı daha derinlemesine araştırmak için yorumlanabilirlik ve sağlam izleme mekanizmalarına çok daha fazla yatırım yapmalıyız.
Yapay zekâyı insanlaştırmanın ve onu potansiyel olarak ahlaki bir sorumluluk duygusuna sahip olarak düşünmeye teşvik etmenin, yapay zekânın güvenliğini, uyumunu ve kontrol altına alınma risklerini artırdığı hipotezimin doğru olup olmadığını anlamak için ortak bir değerlendirme seti oluşturmalıyız.
Bu modelleri nasıl oluşturduğumuz, onları tanımlamak, incelemek ve değerlendirmek için kullandığımız dil ve eğitim materyallerimizi kamuoyunun geri bildirimine ve istişaresine sunma konusunda ortak endüstri standartları oluşturmak için çalışmalıyız.
Bu konularda benimle aynı fikirde olmayanlar bile, bunun görmezden gelemeyeceğimiz bir şey olduğu konusunda hemfikirler. Şu anda hangi tür yapay zekâyı geliştirmek istediğimiz ve dünyadaki yeri hakkında alınan kararlar, toplumumuzu on yıllarca şekillendirecek. Bunlar, herhangi bir şirketin kapsamının çok ötesinde.
İnançlarımız ne olursa olsun, sonradan acı bir şekilde pişman olacağımız bir karara doğru bilinçsizce ilerlememeliyiz.
https://mustafa-suleyman.ai/a-warning-about-model-welfare
Referanslar için: Taksonomiyi PDF olarak indirin.