Anthropic, Claude Yapay Zeka Modellerinde Gizli 'Düşünme Alanı' Tespit Etti
Anthropic
Microsoft
Anthropic araştırmacıları, Claude dil modellerinde kendiliğinden oluşan ve 'J-Space' olarak adlandırılan iç işleme alanı tespit etti; bu alan, yapay zekanın fikirleri kullanıcılara sözlü olarak ifade etmeden saklayıp işlediği bir bölge gibi görünüyor. Bu keşif, yapay zeka düşüncesinin insan bilişine ne kadar benzediği ve gizli yapay zeka niyetlerini tespit etmenin sonuçları hakkında soruları gündeme getiriyor.
Anthropic, Claude dil modellerinde kendiliğinden ortaya çıkan bir iç çalışma alanı tespit etti. Bu alan, bu süreçleri izlemek için kullanılan Jacobi yöntemine atfen 'J-Space' olarak adlandırıldı. Bu alanda yapay zeka, fikirleri kullanıcılarla paylaştığı 'düşünce zincirinden' ayrı olarak planlıyor ve işliyor gibi görünüyor; tıpkı insanların bir şeyi yaparken başka bir şeyi düşünmesine benzer şekilde. Araştırmacılar, Claude'un kod hatalarını tespit etme ve görüntüleri tanımlama gibi zihinsel görevleri bu adımları söze dökmeden gerçekleştirdiğini gözlemledi. Bu davranış, Bernard Baars'ın küresel çalışma alanı teorisiyle paralellikler taşıyor, ancak dil modellerinin mimarisi insan beyninden temel olarak farklıdır. Bu keşif, yapay zeka modellerindeki gizli niyetleri veya uyumsuzlukları ortaya çıkarmaya yardımcı olabilir. Ancak uzmanlar, yapay zekayı insansılaştırmaya karşı uyarıyor; Microsoft'un yapay zeka başkanı Mustafa Suleyman, 'bilinçli yapay zeka'ya inanmanın ciddi sonuçları olabileceği konusunda uyardı. Anthropic'in araştırma makalesi 'bilinç' kelimesini 200'den fazla kez kullanıyor ve şirket yakın zamanda Claude'un oturumlar arasında bilgi işlediği bir 'rüya görme' özelliği tanıttı.
Kaynak: t3n —
orijinal
