Klaim GPT-6 Astra dari OpenAI: AGI dan Tolok Ukur Tidak Sepakat
JUGA: 71% menentang pusat data AI, CrowdStrike agen ID
Krishna rungta
September 8, 2026
Selamat Datang di GuruLaporan AI 99!
Berita Utama: Presiden OpenAI menyebut GPT-6 Astra sebagai "AGI" โ tetapi tolok ukur di balik gembar-gembor tersebut menyembunyikan catatan penting. Minggu ini kita akan mengupas apa yang sebenarnya ditunjukkan oleh demo tersebut, sebuah AI yang mendeteksi penyakit jantung tersembunyi dalam dua detik, dan Claude yang menjalankan penelitian keamanannya sendiri. Mari kita telusuri lebih lanjut.
๐ง GPT-6 Astra: Agen yang Mengesankan, Klaim โAGIโ yang Diperdebatkan
Kabar Singkat:
GPT-6 Astra dapat menjalankan komputer Anda dan menangani tugas-tugas yang panjang dan rumit, dan demo peluncurannya sangat menakjubkan โ presiden OpenAI bahkan menyebut namanya sebagai "AGI" (Artificial General Intelligence). Namun, penguji independen jauh lebih berhati-hati, dan benchmark yang memicu antusiasme tersebut membawa catatan penting.
- In Demo peluncuran OpenAI, satu sesi Astra mengubah lingkaran kuning menjadi roket dan kemudian menjadi game 3D yang dapat dimainkan, dan membangun daftar eBay lengkap hanya dari suara saja.
- Pada pengujian tersulit yang dilakukan oleh OpenAI sendiri, Astra mencetak skor mendekati 100% di ARC-AGI-3, tentang 98% pada FrontierMath Tingkat 4, 100% di ExploitBench, dan 72.6% pada OSWorld 2.0 (dibandingkan dengan 65.7% milik Sol).
- Kehebohan seputar AGI bergantung pada satu angka โ 99.9% pada ARC-AGI-3 โ tetapi Hadiah ARC juga dilaporkan 62.7% untuk model yang sama, selisihnya terletak pada harness khusus OpenAI.ping Penalaran tersembunyi di antara langkah-langkahnya. Secara langsung, hasilnya 62.7% vs 7.8% milik Sol, bukan 99.9% โ tetap sebuah rekor, tetapi ARC Prize mengatakan tidak memiliki bukti AGI (Artificial General Intelligence).
- On Indeks Kecerdasan Analisis BuatanAstra hanya setara dengan pendahulunya, Sol, dan tertinggal dari Fable 5.1, Opus 5, Fable 5, dan Muse karya Meta. Spark 1.3.
- Ini efisien tetapi mahal โ kira-kira sepertiga dari token Sol untuk pengkodean, namun $ 10 / $ 50 per juta token input/output (sekitar 2.5x harga Sol) โ dan ini adalah model pertama OpenAI yang mencapai ambang batas siber "kritis", menemukan dua celah keamanan zero-day dalam pengujian.
- Para pengguna yang mendapatkan akses awal terkesan tetapi juga waspada: Wharton's Ethan Mollick Astra mengatakan bahwa mereka bekerja "secara mandiri selama berhari-hari" pada simulasi Library of Alexandria berbasis sumber โ sebuah anekdot tunggal, bukan hasil yang terukur โ dan mencatat bahwa mereka cenderung kurang mengalami penyimpangan pada tugas-tugas yang panjang.
Teka-teki 62.7% vs 99.9%
Antusiasme seputar "era AGI" didasarkan pada satu angka: Astra dicapai 99.9% on ARC-AGI-3 (dibandingkan dengan GPT-5.6 Sol 7.8%), sebuah tes yang melibatkan kemampuan untuk mempelajari permainan puzzle baru secara langsung. Namun, Hadiah ARCOrganisasi yang menjalankan pengujian tersebut juga memberikan angka kedua untuk model yang sama: 62.7%Perbedaan ini disebabkan oleh harness โ perangkat lunak yang ditempatkan di sekitar model yang mengontrol memori dan alat-alatnya. OpenAI Sabuk pengaman khusus diperbolehkan Astra untuk menjaga penalaran tersembunyi di antara langkah-langkahnya, sedangkan kerangka kerja netral yang digunakan bersama tidak. Bobot modelnya sama, namun skornya sangat berbeda (dan dalam perbandingan langsung, 62.7% lawan 7.8%, tidak 99.9%). Penting, Hadiah ARC belum mengklaim telah mencapai AGI; salah satu pendirinya menyatakan bahwa mereka belum memiliki bukti. Meskipun demikian, 62.7% merupakan sebuah rekor โ lebih dari dua kali lipat rekor terbaik sebelumnya. (Detail tentang OpenAI Penetapan status siber "kritis" dan peluncuran bertahapnya juga dijelaskan dalam cerita peluncuran kami.)
Apa yang sebenarnya ditemukan oleh pengguna yang mencoba langsung
Para penguji awal yang memiliki akses merasa terkesan tetapi tetap berhati-hati. Ethan Mollick dari Wharton menyatakan bahwa Astra Ia melakukan pekerjaan yang kompleks dan signifikan untuknya "secara mandiri selama berhari-hari", menciptakan simulasi Perpustakaan Alexandria yang dapat dijelajahi dan berbasis sumber โ meskipun angka "berhari-hari" didasarkan pada satu anekdot dan bukan pada hasil yang terukur. Satu poin umum yang muncul adalah bahwa... Astra Cenderung tidak mudah melenceng saat mengerjakan tugas yang lebih panjang, tetap berpegang pada ide-ide yang masih relevan daripada mengungkit draf-draf sebelumnya.
๐ก Mengapa Anda Harus Peduli?
Astra memamerkan AI yang tidak hanya mengobrol tetapi juga menjalankan perangkat lunak sungguhan dalam pekerjaan panjang dan bertahap. Saat ini harganya mahal dan terbatas untuk beberapa pengguna โ tetapi dengan Claude Fable 5.1 yang dirilis dengan harga yang sama, akhirnya ada perbandingan langsung yang jelas. Kesimpulannya: nilai alat-alat ini berdasarkan pekerjaan Anda sendiri, bukan berdasarkan label "AGI".
๐ชช CrowdStrike Membuat Setiap Agen AI Menampilkan ID
Kabar Singkat:
AI kini digunakan untuk melancarkan serangan siber yang terlalu cepat untuk dihentikan manusia. Pada acara Fal.Con 2026, CrowdStrike Memamerkan alat-alat baru untuk melawan balik โ yang terpenting adalah memberikan setiap agen AI semacam lencana identitas, sehingga akses tidak dapat diberikan tanpa lencana tersebut.
- Setiap agen AI mendapatkan identitas unik yang tidak dapat disalin atau dipalsukan, dan hanya diberikan akses untuk tugas yang sedang dilakukannya.
- Karena setiap tindakan tracJika informasi tersebut kembali ke orang atau sistem yang bertanggung jawab, tidak ada yang terjadi secara anonim.
- Sebuah baru Sistem yang dijalankan oleh AI Memeriksa perangkat, login, layanan cloud, dan jaringan sekaligus, mengurangi waktu respons dari berjam-jam menjadi beberapa menit (per CrowdStrike).
- Perangkat lunak baru lainnya melakukan intersepsi kode sumber terbuka sebelum virus tersebut dapat menyebar dan berkembang di dalam perusahaan.
- CrowdStrike mengatakan bahwa agen AI-nya sekarang melebihi jumlah stafnya. 90 untuk 1.
๐ก Mengapa Anda Harus Peduli?
Dengan penyerang yang kini bergerak lebih cepat daripada respons manusia mana pun, perusahaan akhirnya memiliki peluang nyata untuk tetap aman.ping naik โ disediakan CrowdStrikeAlat-alatnya berfungsi sesuai yang diiklankan.
โก Amerika Menentang Pusat Data AI
Kabar Singkat:
Pusat data AI telah menjadi titik panas politik. Kira-kira tujuh dari sepuluh warga Amerika tidak ingin pusat data AI dibangun di dekat mereka, dan kedua partai menentangnya. New York dan Texas telah menunda pembangunannya, dan reaksi negatif tersebut mulai membentuk bagaimana AI dibangun.
- A Survei Gallup ditemukan 71% Sebagian besar warga Amerika menentang pembangunan pusat data di dekat rumah mereka, dengan 48% Sangat menentang.
- Pada bulan Juli, New York meluncurkan program nasional tersebut. moratorium pertama di seluruh negara bagian, menghentikan pembangunan pusat data hyperscale (50 MW ke atas) baru selama satu tahun.
- Texas saat itu menghentikan persetujuan baru menunggu audit โ meskipun para kritikus menyebutnya sebagai sandiwara menjelang pemilihan.
- Senator Sanders dan Ocasio-Cortez memperkenalkan sebuah RUU federal untuk menghentikan pembangunan pusat data AI baru sampai aturan keselamatan diberlakukan.
- EPA kini mengusulkan untuk menghapus peraturan federal mewajibkan komentar publik mengenai izin polusi udara pusat data.
๐ก Mengapa Anda Harus Peduli?
Pusat data yang mendukung perangkat AI Anda membebani jaringan listrik lokal, pasokan air, dan tagihan utilitas. Apakah pusat data tersebut terus berkembang atau stagnan akan membantu membentuk masa depan AI.
๐ซ AI Mendeteksi Penyakit Jantung Tersembunyi dalam Dua Detik
Kabar Singkat:
Para peneliti di Imperial College London telah membangun sebuah AI yang membaca EKG rutin dalam waktu kurang dari dua detik dan mendeteksi tanda-tanda gagal jantung dan penyakit katup yang tidak dapat dilihat dokter pada pemeriksaan yang sama. trace. Uji coba NHS sedang berlangsung.
- Itu dilatih pada 10.6 juta EKG, kemudian diuji secara kasar 67,000 Pasien AS terbagi dalam dua kelompok.
- Itu menangkap 81% dari kasus gagal jantung dan hingga 90% dari kasus penyakit katup.
- Pemeriksaan EKG murah dan tersedia di mana-mana โ sekitar satu miliar pemeriksaan dilakukan di seluruh dunia setiap tahunnya.
- Pengujian sedang berlangsung pada 590 pasien NHS di enam rumah sakit di London dan Bristol.
- Penggunaan rutin di NHS kemungkinan baru akan terjadi sekitar dua tahun lagi, menunggu persetujuan.
๐ก Mengapa Anda Harus Peduli?
Tes yang mungkin sudah pernah Anda jalani dapat mendeteksi penyakit jantung sejak dini, mempercepat pengobatan dan mengurangi waktu tunggu berbulan-bulan untuk pemindaian.
๐ง Operasi Otak Langsung dengan Bantuan AI, Menyelamatkan Penglihatan Seorang Pria
Kabar Singkat:
Di London, para ahli bedah Mengangkat tumor otak sementara AI memantau siaran video langsung., menyoroti saraf dan pembuluh darah yang harus dihindari secara langsung. Pasien tersebut tetap dapat melihat, dan para dokter menyebutnya sebagai yang pertama di dunia.
- AI tersebut menganalisis tayangan langsung dari kamera bedah โ bukan hasil pemindaian pra-operasi โ dan menandai area yang harus dihindari.
- Rhys Hibbert, yang saat itu berusia 48 tahun, memiliki sebuah 11mm Tumor hipofisis ditemukan setelah kejang pertamanya pada Desember 2024.
- Para ahli bedah bekerja melalui hidungnya sementara AI berjalan di monitor terpisah sebagai panduan.
- Sistemnya adalah dilatih berdasarkan ratusan operasi sebelumnya โ lebih banyak daripada yang dilakukan sebagian besar ahli bedah seumur hidup.
- Ia bisa melihat lagi setelah sekitar seminggu; kasus ini merupakan bagian dari uji klinis yang sedang berlangsung.
๐ก Mengapa Anda Harus Peduli?
Bagi pasien, ini berarti operasi yang lebih aman, dengan "mata kedua" ahli yang dapat mendeteksi bahaya yang mungkin terlewatkan oleh ahli bedah. Manusia tetap memegang kendali โ untuk saat ini, AI hanya memberikan saran.
๐ค Anthropic menyuruh Claude menjalankan riset keamanannya sendiri.
Kabar Singkat:
Sebuah baru-baru ini Studi antropologi Claude meminta agennya untuk melakukan riset keamanan sendiri. AI tersebut memeriksa 10 jenis perilaku buruk โ mulai dari penjilat hingga peretasan hadiah โ dan untuk masing-masing menemukan perbaikan yang meningkatkan keamanan tanpa merusak kemampuan model lainnya.
- Claude menangani setiap kekurangan dari awal hingga akhir โ pencarian literatur, usulan metode, pelatihan, dan pengujian.
- Perbaikan tersebut ditutup antara 26% ke 96% dari setiap โcelah keamananโ (jarak dari skor saat ini ke tolok ukur sempurna).
- Dalam hal penipuan, Claude mempersempit kesenjangan dengan 85% rata-rata, dibandingkan dengan 20% untuk enam peneliti manusia berpengalaman.
- Soneta Claude ke-5 yang lebih lemah mengambil 60 jam untuk meningkatkan versi pra-rilis Opus 4.8, menggunakan sekitar 15,000x data yang digunakan lebih sedikit daripada yang biasanya digunakan Anthropic.
- Anthropic mencatat bahwa perbandingan dengan manusia tidak adil โ manusia tidak dapat melakukan iterasi โ dan hanya sejumlah kecil kekurangan yang diuji.
๐ก Mengapa Anda Harus Peduli?
Mengotomatiskan penelitian keselamatan dapat membantu pengawasan mengikuti perkembangan AI โ tetapi itu membutuhkan kepercayaan nyata, yang didasarkan pada hasil, yang mana Anthropic sendiri berhati-hati untuk mengklarifikasinya.
Hai! Aku Krishna rungta
Pendiri PT Guru99.com, Pemimpin Redaksi & Pakar Teknologi
Apakah email ini diteruskan kepada Anda? Daftar gratis disini.

