4 soruda OpenAI'ın "düşünebilen" yeni yapay zeka serisi

OpenAI'ın son modeli o1'in fiyatı, bazı kullanıcıların tepkisini çekiyor (Reuters)
OpenAI'ın son modeli o1'in fiyatı, bazı kullanıcıların tepkisini çekiyor (Reuters)
TT

4 soruda OpenAI'ın "düşünebilen" yeni yapay zeka serisi

OpenAI'ın son modeli o1'in fiyatı, bazı kullanıcıların tepkisini çekiyor (Reuters)
OpenAI'ın son modeli o1'in fiyatı, bazı kullanıcıların tepkisini çekiyor (Reuters)

OpenAI, "düşünme" becerisine sahip olduğunu öne sürdüğü yeni yapay zeka serisi o1'i dün (12 Eylül Perşembe) kullanıma sundu. 

Strawberry diye de bilinen yeni serinin o1-preview (ön izleme) ve o1-mini diye iki sürümü mevcut.

Model henüz sadece ChatGPT Plus ve Team kullanıcılarının yanı sıra 5. seviye API katmanına hak kazanan geliştiricilerin erişimine peyderpey açılıyor.

ChatGPT Enterprise ve Edu üyelerinin de gelecek haftadan itibaren araca erişebileceğini belirten şirket, ileride o1-miniyi bütün kullanıcılara ücretsiz sunmayı planlıyor. Fakat bunun için henüz bir tarih verilmedi.

Daha önceki modellerine 2,3,4 gibi isimler veren OpenAI, son serinin yepyeni becerilere sahip olması nedeniyle "sayacı sıfırladıklarını" ve bu nedenle o1 adını seçtiklerini belirtiyor.

Tabii bütün bunların bir bedeli var. Kullanımı mayısta çıkan öncülü GPT-4o'dan üç kat daha masraflı olan o1-preview'un geliştiricilere maliyeti 1 milyon girdi jetonu (token) başına 15 dolar, 1 milyon çıktı jetonu başına da 60 dolar.

Veri birimlerini ifade eden jetonlar, yapay zeka araçlarının büyük verileri parçalara ayırıp dili işlemesini sağlıyor. 1 milyon jeton yaklaşık 750 bin kelimeye denk geliyor. 

OpenAI, o1-mini versiyonun yüzde 80 daha ucuz olduğunu belirtiyor fakat bu sürüm diğeri kadar geniş bir bilgi yelpazesine sahip değil. 

Peki şirketin ön izleme veya bir ön sürüm olduğunu belirttiği o1, öncüllerinden farklı olarak neyi yapabiliyor, neyi yapamıyor ve insanlığın kendi bilişsel seviyesini geçen yapay zeka inşa etme çabasında nasıl bir adıma işaret ediyor?

1) Gerçekten düşünebiliyor mu?

Teknoloji sektöründeki en temel tartışmalardan biri, yapay zeka araçlarının becerilerini "düşünme" veya "muhakeme" gibi ifadelerle tanımlama etrafında dönüyor. 

Geniş dil modellerinin, devasa büyüklükte bilgi kümeleriyle eğitildiği ve sorgulara verdikleri cevaplarda bu veriler üzerinden olasılık temelli tahmin yürüttükleri göz önüne alınırsa, bazı uzmanların "düşünme" ifadesine itirazlarında haklılık payı var. 

Öte yandan bu araçlar insan beyni gibi akıl yürütme becerisine gittikçe daha fazla yaklaşıyor. 

OpenAI, o1 serisinin sorulara cevap vermeden önce daha uzun süre düşündüğünü ve vereceği yanıtların doğruluğunu kontrol ettiğini ifade ediyor.

Sisteme girilen soru karşısında "Düşünüyorum" gibi yanıtlar vermesi, gerçekten o sırada düşündüğü izlenimi yaratsa da o1'in insanlar gibi akıl yürüttüğünü söylemek mümkün değil. 

OpenAI'ın araştırma ekibinin lideri Jerry Tworek, yapay zeka modelinin düşünme biçimini insanlarınkiyle bir tutmadıklarını söylüyor. 

Arayüz ise yeni modelin problemleri çözerken daha fazla zaman harcadığını ve daha derine indiğini gösterme amacıyla bu şekilde tasarlanmış.

o1'i önceki OpenAI uygulamalarından ayıran temel özelliğiyse eğitilme biçiminde yatıyor. 

Eğitim bilimci ve öğretmenlerin aşina olabileceği pekiştirmeli öğrenme denen bu yöntem, doğru yanıtlar karşısında ödül, yanlış cevaplar karşısında da ceza verilmesi ilkesine dayanıyor.

Bu sayede deneme yanılmayla ilerleyen yapay zeka aracının, doğru yanıtlara ulaşma becerisi gelişiyor. Sorguları işlerken, insanların sorunları adım adım inceleyerek çözmesine benzer bir "düşünce zinciri" kullanıyor.

OpenAI, aracı "düşünmeye" iten bu yöntemin, doğruluğunu artırdığını ifade ediyor. 

2) Hangi alanlarda kullanılacak?

Karmaşık muhakeme görevlerinde kayda değer bir ilerlemeye ve yeni bir yapay zeka yeteneği seviyesine işaret ediyor. Bu nedenle sayacı tekrar 1'e sıfırlıyor ve bu seriye OpenAI o1 adını veriyoruz.

OpenAI'ın bu ifadelerle tanıttığı o1'in, dil becerilerinden ziyade bilimsel çalışmalar, veri işleme ve kodlamada daha iyi bir performans sergilemesi bekleniyor. Ayrıca o1-mini, daha küçük bir sürüm olmasına karşın özellikle kod üretmesi amacıyla geliştirildi. 

Yeni model kodlama ve matematikte sonuca ulaşma sürecini detaylandırdığı için bu alanlarda öğretmenlik yapma becerisinin önceki versiyonlardan daha iyi olması bekleniyor. 

Şirketin baş araştırma görevlisi Bob McGrew, yeni modelin ileri seviye matematik sorularında kendisinden daha iyi olduğunu belirterek kendisinin üniversitede matematik okuduğunu ekliyor.

OpenAI yeni modelin ayrıca bilim insanlarının hücre dizileme çalışmalarına ve fizikçilerin karmaşık matematiksel formüller üretmesine katkı sağlayacağını ifade ediyor. 

Ayrıca yapılan testlerde fizik, kimya ve biyolojinin bazı alanlarında doktora öğrencileriyle yarıştığı kaydedildi.

Şirketin baş bilim insanı Dr. Jakub Pachocki ve OpenAI teknik çalışanı Szymon Sido, New York Times'a yaptıkları sunumda, sohbet botunun çengel bulmacadan çok daha karmaşık akrostiş bulmacasını çözdüğü görüldü.

Yapay zeka aracı aynı zamanda doktora düzeyinde bir kimya sorusunu yanıtladı ve bir hastanın semptomları ve geçmişi hakkında ayrıntılı bir rapora dayanarak hastalığı teşhis etti.

3) GPT-4o'dan daha mı iyi?

Daha önceki modeller internetteki bilgilerle eğitildiği ve internette epey yanlış bilgi olduğu için hata yapma ihtimalleri artıyor. o1'in eğitilme biçimiyse bu hataları çok daha düşük seviyeye indirmesini sağlıyor. 

Yeni modelin; ses, görüntü ve yazıyla iletişim kuran GPT-4o'dan çok daha iyi performans gösterdiği alanlar olsa da bazı konularda gerisinde kalıyor. 

İki aracı da lise seviyesindeki Uluslararası Matematik Olimpiyatı'na sokan OpenAI, o1'in soruların yüzde 83'ünü, GPT-4o'nun ise sadece yüzde 13'ünü doğru çözdüğünü ifade ediyor. 

Thomson Reuters'tan yeni modeli test eden Pablo Arredondo, TechCrunch'a yaptığı açıklamada yasal belgeleri analiz etme ve hukuk fakültesine giriş sınavında da daha başarılı olduğunu söylüyor.

Strawberry takma adına sahip o1'in GPT-4o'yu geride bıraktığı bir diğer alan ise "strawberry" (çilek) kelimesinde kaç tane "r" harfi olduğunu bulmak.

Bu soruya "iki" yanıtını veren ChatGPT'nin önceki sürümleri internette alay konusu olmuştu. 

İlk başta çok zor bir görev gibi görünmese de yapay zeka araçları kelimeleri harf harf değil, jetonlar şeklinde işlediği için bu tip basit işlerde zorlanabiliyorlar. 

Ancak o1, daha detaylı düşünmesi ve kendisini kontrol etmesinden dolayı bu soruya doğru yanıtı vermeyi başardı. 

Öte yandan yeni model, internette arama yapma, metin ve görsel işleme gibi özelliklere henüz sahip değil. Ayrıca gerçek dünya hakkında GPT-4o kadar bilgisi de yok. 

Pennsylvania Üniversitesi Wharton İşletme Okulu'nda yapay zeka üzerine çalışan Ethan Mollick "Açıkçası o1-preview her şeyde daha iyi değil. Örneğin GPT-4o'dan daha iyi bir yazar değil" diyerek ekliyor: 

Ancak planlama gerektiren görevlerde ciddi değişiklikler sözkonusu.

OpenAI, yeni modelinde halüsinasyon sorununu da çözmeyi henüz başaramadı. Yapay zeka sohbet botlarının bazı bilgileri "uydurmasını" ifade eden halüsinasyon, bu araçların temel sorunu olmaya devam ediyor.

Modeli test eden Mollick, zorlu bir bulmacayı çözdüğünü ancak ipuçlarından birini uydurduğunu söylüyor. 

Yine de Tworek, "Bu modelin daha az halüsinasyon gördüğünü fark ettik" diyerek ekliyor: 

Ancak sorun hâlâ devam ediyor. Halüsinasyonları çözdüğümüzü söyleyemeyiz.

Son modelin bir diğer eksikliği de sorgulara yavaş cevap vermesi. Diğer sürümler neredeyse anında yanıtı sunarken, muhtemelen düşünme süresinden dolayı o1'in cevap vermesi çok daha uzun zaman alıyor.

Örneğin Mollick, bulmacayı çözmesinin 108 saniye sürdüğünü ifade ediyor.

OpenAI modelin ön izleme versiyonu olduğunu belirtirken, uzmanlar o1'in sonraki versiyonlarının hızlanmasını umuyor. 

4) İnsanlığa tehdit oluşturabilir mi?

Bazı yapay zeka araçları eğitimleri sırasında farklı kelimelerin beraber kullanılma sıklıklarını analiz ederek sözcüklerin birbirine yakınlığını tahmin ediyor. Örneğin "kedi" ve "köpek" kelimeleri birlikte daha sık kullanıldığı için yakın anlamlara sahip olmaları gerektiği sonucuna varıyor.

Bu modellerin "yapay zeka" ve "tehdit" ifadeleri arasında da böyle bir ilişki kurmuş olması muhtemel. 

Her yeni modelin piyasa sürülmesiyle akla gelen ilk sorulardan biri insanlığa varoluşsal bir tehdit yaratıp yaratmayacağı.

Sektörün önde gelen bazı isimleri bu tehlikeye karşı uyarırken bazı uzmanlar yapay zeka araçlarının nasıl kullanıldığının daha önemli olduğunu vurguluyor.

OpenAI'ın son sürümüyle bu araçların insan gibi düşünme becerisine bir adım daha yaklaşması da endişeleri artırabilir.

Ancak bu yazıdan da anlaşılabileceği üzere, o1'in becerileri henüz korkutucu bir düzeyin yakınından bile geçmiyor. 

Ars Technica'nın ifade ettiği gibi bir bulmacadaki 8 ipucunu çözmesi 108 saniye süren ve bir cevapta halüsinasyon gören bir yapay zeka modelinin potansiyel tehlike olduğunu söylemek abartıya kaçar. 

Öte yandan OpenAI'ın yanı sıra Meta ve Google gibi şirketlerin de çabaları ve son yıllardaki hızlı gelişmeler göz önüne alınırsa, insan seviyesine ulaşan yapay zeka araçları çok uzak olmayabilir.

Independent Türkçe, TechCrunch, Verge, Ars Technica, New York Times, OpenAI



iPhone 18 bu yıl çıkmayacak mı?

Fotoğraf: Reuters
Fotoğraf: Reuters
TT

iPhone 18 bu yıl çıkmayacak mı?

Fotoğraf: Reuters
Fotoğraf: Reuters

Çeşitli haberlere göre bu yıl yeni iPhone 18 çıkmayabilir.

Apple'ın eylüldeki klasik tanıtım etkinliğini 2026'da da düzenleyeceği yönünde güçlü bir beklenti var. Ancak söylentilere göre bu etkinlikte şirket, üst düzey Pro modellerinin güncellemeleri ve daha da pahalı olan Ultra versiyonuna odaklanacak.

Bu durumda telefonun temel modelinin güncellenmiş versiyonu (yani standart iPhone 18) gelecek yıl ilkbahardan önce piyasaya çıkmayabilir.

Apple'ın, cihazlarını piyasaya sürme takvimini değiştireceği söylentileri uzun süredir dolaşıyor. Ancak Tayvan merkezli Economic Daily News'ta yayımlanan yeni bir haber, bu spesifik takvime yeni bir inandırıcılık kazandırdı.

Haberde, Apple tedarikçisi ve Tayvanlı elektronik üreticisi Pegatron'un bilanço toplantısına atıf yapılıyor. Yöneticilerin, iPhone 18 Pro serisinin sonbaharda güncelleneceğini ancak temel modelin gelecek yılın ilk çeyreğine kadar piyasaya çıkmayacağını söylediği bildiriliyor.

Aynı dönemde iPhone Air'ın güncellenmiş bir versiyonu da yeni iPhone 18e'yle birlikte piyasaya çıkacak. Apple'ın bu yıl martta 17e'yi (daha yavaş bir işlemci ve daha basit bir kamera sistemi gibi kısıtlamalarıyla telefonun daha ucuz bir versiyonu) çıkarması, telefonlar için yeni ve kademeli bir piyasaya sürme stratejisinin önizlemesi olarak değerlendirilmişti.

Apple'ın, eylüldeki lansman etkinliğinde bu daha ucuz modeller yerine iPhone 18 Pro ve iPhone'un ilk "Ultra" versiyonunu tanıtacağı düşünülüyor. Ultra'nın, Apple'ın ilk katlanabilir cihazı olacağı geniş çapta söylenirken, daha önce üretilen herhangi bir iPhone'dan çok daha pahalı olabilir.

Apple'ın, temel modellerin piyasaya sürülmesini yılın ilerleyen aylarına ertelemek için iPhone lansman takvimini değiştirdiği söylentileri uzun süredir dolaşıyordu. Ancak son aylarda sektörü etkisi altına alan çip kıtlığı nedeniyle bu plan daha da faydalı hale gelmiş olabilir.

Şirket, en son kazanç açıklamasında mevcut telefon serisine yönelik talebi karşılamak için yeterli miktarda çip satın almakta zorlandığını belirtmişti. Yapay zeka sektörünün aynı çiplere yönelik talebi nedeniyle çip fiyatlarında görülen artış sonucu şirket, iPad'ler ve Mac'ler gibi cihazlarının fiyatını önceki aylarda artırmıştı.

Independent Türkçe


Rusya, Starlink'e rakip olacak projeyi hızlandırıyor

Rusya'nın Rassvet uyduları, ülkede kullanımı yasak olan SpaceX'in Starlink internet ağına alternatif sunuyor (Bureau 1440)
Rusya'nın Rassvet uyduları, ülkede kullanımı yasak olan SpaceX'in Starlink internet ağına alternatif sunuyor (Bureau 1440)
TT

Rusya, Starlink'e rakip olacak projeyi hızlandırıyor

Rusya'nın Rassvet uyduları, ülkede kullanımı yasak olan SpaceX'in Starlink internet ağına alternatif sunuyor (Bureau 1440)
Rusya'nın Rassvet uyduları, ülkede kullanımı yasak olan SpaceX'in Starlink internet ağına alternatif sunuyor (Bureau 1440)

Ukraynalı yetkililere göre Rusya, SpaceX'in Starlink ağına rakip olacak bir uydu internet sisteminin kurulumunu hızlandırıyor.

Yerdeki insanlara yüksek hızlı geniş bant internet sağlayan Rassvet ağı halihazırda 16 uyduyla faaliyet gösteriyor ancak gelecek yıl itibarıyla yaklaşık 300 uyduya ulaşması bekleniyor.

Starlink, Rusya'da yasaklı olsa da Ukrayna'da yaygın kullanılıyor ve drone operasyonlarıyla savaş alanı iletişiminde Kiev'e büyük avantaj sağlıyor.

SpaceX patronu Elon Musk, Kiev'in Starlink hizmetini Rusya içine drone saldırıları için kullanma çabalarını, bunun çatışmanın tırmanmasına yol açabileceği gerekçesiyle engellemişti.

Rus güçleri, Ukrayna'da resmi olmayan kanallardan temin edilen Starlink terminallerini kullanıyordu. Ancak Kiev, bu yıl SpaceX'i bu terminalleri devre dışı bırakmaya ikna etmeyi başardı. Bu gelişme, savaş alanındaki ivmenin Ukrayna lehine dönmesini sağlayan faktörlerden biri oldu.

Ukrayna medya kuruluşu RBC-Ukrayna'ya verdiği bir röportajda, Ukrayna GUR askeri istihbarat servisinin başkan yardımcısı Tümgeneral Vadym Skibitskyi, Rusya'nın Rassvet ağını daha önce düşünüldüğünden çok daha hızlı kurduğunu söyledi.

Tümgeneral Skibitskyi, "Başlangıçta planlanandan çok daha hızlı bir şekilde fırlatmaya başladılar bile" dedi.

2027'de 292 uydudan oluşan bir uydu takımı oluşturmak ve 2035'e kadar 924 uyduya genişletmek için daha fazla uydu fırlatmaya devam edecekler. Rusya tam bir uydu takımı kurduğunda, sistem Starlink gibi çalışacak. Buna karşı nasıl önlem alınacağına dair görüşmeler şimdiden başladı.

Rus havacılık ve uzay şirketi Bureau 1440 tarafından geliştirilen sistem, Ukrayna istihbaratına göre, halihazırda yalnızca uydulardan biri Ukrayna toprakları üzerinden geçtiğinde aralıklı olarak çalışabiliyor.

SpaceX'in Starlink ağı, alçak Dünya yörüngesinde 10 binden fazla faal uyduya sahip ve mevcut boyutunun 4 katına çıkarılması planlanıyor.

Diğer ticari uzay internet girişimleri arasında Eutelsat'ın OneWeb'i ve Amazon Leo yer alıyor; her ikisi de halihazırda birkaç yüz uydu fırlattı.

Ajanslardan da yararlanılmıştır

Independent Türkçe


Anthropic'in yapay zekası kullanıcılar adına karar vermeye başlayacak

Fotoğraf: Reuters
Fotoğraf: Reuters
TT

Anthropic'in yapay zekası kullanıcılar adına karar vermeye başlayacak

Fotoğraf: Reuters
Fotoğraf: Reuters

Anthropic, Claude'un kullanıcı adına işlem yapmasına artık varsayılan ayar olarak izin verecek.

Şirket, sohbet botunun kullanıcısı adına işlem yapmasına izin veren "otomatik" modunu varsayılan olarak etkinleştiriyor. Anthropic, bir eylem "geri döndürülemez veya yıkıcı olmadığı ya da kullanıcının çalışma ortamı dışındaki sistemleri hedeflemediği" sürece Claude'un bunu otomatik olarak gerçekleştireceğini söylüyor

Bu güncelleme, "kontrolden çıkabilecek" yapay zeka sistemleri ve bunların kendi başlarına hareket etmelerine izin verilmesi halinde doğurabilecekleri riskler hakkında yaygın endişelerin yaşandığı bir dönemde geliyor. Bu endişeleri, aralarında Claude'un da bulunduğu yapay zeka sistemlerinin çeşitli kuruluşlara ve kişilere yönelik siber saldırılarda kullanıldığına ilişkin haberler körüklüyor.

Ancak Anthropic, Claude'un bir eylemin tehlikeli olup olmadığını belirlemede genellikle insanlardan daha iyi olduğunu söyledi. Şirket, 1053 ücretli kullanıcının katıldığı deneyler de dahil son birkaç ay boyunca, otomatik modun ortalama bir kullanıcıdan daha iyi performans gösterip göstermediğini test etti. Sonuçlar, otomatik modun test edilen bütün ölçütlerde "manuel incelemeyle aynı düzeyde veya ondan daha iyi performans gösterdiğini" ortaya koydu.

Bu özellik, Claude Code'da yalnızca "Pro", "Max" veya "Team" ücretli aboneliklerine sahip kullanıcılar için varsayılan olarak etkinleştirilecek. Dolayısıyla otomatik mod, kullanıcıların sohbet botuna mesaj gönderirken karşılaştığı standart Claude sürümünü değil, yalnızca program yazma veya yazılım mühendisliğinde kullanılan sürümleri etkileyecek.

Anthropic'te Claude Code'un başındaki Boris Cherny, X'te yaptığı paylaşımda, kendisinin ve ekibinin "aylardır yalnızca otomatik modu kullandığını" söyledi. "Sürekli onay istenen sisteme dönmeyi hayal bile edemiyorum!" diye yazdı.

Anthropic, otomatik modun kullanıcıların onay talepleriyle kesintiye uğramadan çalışmasını sağladığını belirtti. Ancak mod, "zararlı eylemlerden kaçınmak" için tasarlandı ve bir eylemin "geri döndürülemez, yıkıcı veya kullanıcının çalışma ortamı dışındaki sistemleri hedefleyen" bir işlem olabileceği gerekçesiyle defalarca engellenmesi halinde kullanıcıdan manuel onay istemeye geri dönecek.

Anthropic, bu özelliğin Claude'un daha uzun süreler boyunca kendi başına çalışmasına da olanak sağlayacağını söyledi. Şirketin iddiasına göre bu, yazılımcıların yapay zekayı "büyük görevler üzerinde saatlerce çalışır durumda bırakabilmeleri" ve böylece kullanıcı girdisine ihtiyaç duymadan daha fazla iş yapabilmeleri anlamına geliyor.

Independent Türkçe