GPT-6 Astra firmy OpenAI twierdzi, że AGI jest zgodne z wynikami testów porównawczych
WIĘCEJ: 71% sprzeciwia się centrom danych AI, CrowdStrike Agenci ID
Krishna Szczebel
September 8, 2026
Witamy w Guru99 Raport AI!
Najlepsza historia: Prezes OpenAI nazwał GPT-6 Astra „AGI” – ale benchmark, który kryje się za tym szumem, skrywa poważny błąd. W tym tygodniu omawiamy, co tak naprawdę pokazały dema: sztuczną inteligencję wykrywającą ukryte choroby serca w dwie sekundy i Claude'a prowadzącego własne badania nad bezpieczeństwem. Przyjrzyjmy się bliżej.
🧠 GPT-6 Astra: imponujący agent, kwestionowane roszczenie „AGI”
Krótkie podsumowanie:
GPT-6 Astra może obsługiwać komputer i wykonywać długie, skomplikowane zadania, a wersje demonstracyjne są zdumiewające – prezes OpenAI wprowadził etykietę „AGI”. Jednak niezależni testerzy są znacznie ostrożniejsi, a benchmark, który wywołał tak duże emocje, ma dużą wadę.
- In Demo startowe OpenAI, jedna sesja Astry przekształciła żółty okrąg w rakietę, a następnie w grywalną grę 3D i stworzyła kompletną ofertę na eBay, bazując wyłącznie na słowach.
- W najtrudniejszych testach OpenAI Astra uzyskała wynik bliski 100% na ARC-AGI-3, około 98% na poziomie 4 FrontierMath, 100% na ExploitBench i 72.6% w OSWorld 2.0 (w porównaniu do Sol 65.7%).
- Całe zamieszanie wokół AGI opierało się na jednej liczbie — 99.9% na ARC-AGI-3 — ale Nagroda ARC również zgłoszone 62.7% w przypadku tego samego modelu różnica wynika z zastosowania niestandardowej uprzęży OpenAIping Ukryte rozumowanie między krokami. W bezpośrednim starciu to 62.7% w porównaniu z 7.8% w Sol, a nie 99.9% — wciąż rekord, ale ARC Prize twierdzi, że nie ma dowodów na istnienie sztucznej inteligencji ogólnej.
- On Indeks inteligencji sztucznej analizyAstra dorównuje jedynie poprzednikowi Sol i ustępuje Fable 5.1, Opus 5, Fable 5 i Meta's Muse Spark 1.3.
- To wydajne, ale drogie rozwiązanie — stanowi ono około jedną trzecią tokenów Sol przeznaczonych do kodowania, a jednak $ 10 / $ 50 za milion tokenów wejścia/wyjścia (około 2.5-krotności ceny Sol) — i jest to pierwszy model OpenAI, który osiągnął „krytyczny” próg cyberbezpieczeństwa, znajdując dwa dni zerowe podczas testów.
- Użytkownicy korzystający z wczesnego dostępu byli pod wrażeniem, ale zachowali ostrożność: Wharton Ethana Mollicka powiedział, że Astra pracowała „autonomicznie przez wiele dni” nad symulacją Biblioteki Aleksandryjskiej opartą na źródłach — pojedynczą anegdotą, a nie zmierzonym wynikiem — i zauważył, że symulacja mniej dryfuje w przypadku zadań długotrwałych.
Zagadka 62.7% kontra 99.9%
Emocje związane z „erą AGI” opierały się na jednej liczbie: Astra osiągnięty 99.9% on ŁUK-AGI-3 (w porównaniu do GPT-5.6 Sol 7.8%), test polegający na umiejętności uczenia się zupełnie nowych gier logicznych na miejscu. Jednakże, Nagroda ARCOrganizacja przeprowadzająca test podała również drugą liczbę dla tego samego modelu: 62.7%Różnica ta wynika z uprzęży — oprogramowania umieszczonego wokół modelu, które steruje jego pamięcią i narzędziami. OpenAI's dozwolone niestandardowe uprzęże Astra zachować ukryte rozumowanie między krokami, podczas gdy neutralna, współdzielona uprząż tego nie robiła. Wagi modelu były takie same, ale wyniki były bardzo różne (i w bezpośrednim porównaniu jest to 62.7% przeciwko 7.8%, Nie 99.9%). Co ważne, Nagroda ARC nie twierdzi, że osiągnęła AGI; jeden z jej współzałożycieli stwierdził, że nie mają jeszcze na to dowodów. Niemniej jednak, 62.7% to rekord — ponad dwukrotnie wyższy od poprzedniego najlepszego wyniku. (Szczegóły na temat OpenAI's W naszej historii premiery podajemy również oznaczenie „krytyczne” w kontekście cyberzagrożeń i jego etapowe wdrażanie.)
Co faktycznie odkryli użytkownicy, którzy brali udział w zajęciach
Pierwsi testerzy, którzy mieli dostęp do narzędzia, byli pod wrażeniem, ale pozostali ostrożni. Ethana Mollicka z Wharton stwierdził, że Astra wykonał dla niego złożoną i znaczącą pracę „autonomicznie przez wiele dni”, tworząc symulację Biblioteki Aleksandryjskiej, po której można chodzić, opartą na źródłach — chociaż liczba „przez wiele dni” opiera się na pojedynczej anegdocie, a nie na zmierzonym wyniku. Wspólnym punktem, który się pojawił, było to, że Astra ma tendencję do mniejszego odpływania myślami podczas pracy nad dłuższymi zadaniami, trzyma się pomysłów, które są nadal aktualne, zamiast powracać do wcześniejszych wersji.
💡 Dlaczego powinno Cię to obchodzić?
Astra prezentuje sztuczną inteligencję, która nie tylko czatuje, ale faktycznie uruchamia prawdziwe oprogramowanie w ramach długich, wieloetapowych zadań. Na razie jest droga i dostępna tylko dla kilku użytkowników — ale dzięki Claude Fable 5.1 w tej samej cenie, w końcu można je porównać. Wniosek: oceniaj te narzędzia na podstawie własnej pracy, a nie na podstawie etykietki „AGI”.
🪪 CrowdStrike Sprawia, że każdy agent AI pokazuje identyfikator
Krótkie podsumowanie:
Sztuczna inteligencja jest obecnie wykorzystywana do przeprowadzania cyberataków zbyt szybkich, by ludzie mogli je powstrzymać. Podczas konferencji Fal.Con 2026 CrowdStrike zaprezentował nowe narzędzia do obrony — najważniejsze z nich zapewnia każdemu agentowi AI rodzaj identyfikatora, dzięki czemu dostęp nie może zostać przyznany bez niego.
- Każdy agent AI otrzymuje unikalny identyfikator którego nie można skopiować ani podrobić i do którego dostęp jest udzielany wyłącznie w celu realizacji zadania, które wykonuje.
- Ponieważ każda akcja tracWracając do osoby lub systemu odpowiedzialnego za to, nic nie dzieje się anonimowo.
- nowa System obsługiwany przez sztuczną inteligencję sprawdza urządzenia, logowania, usługi w chmurze i sieci jednocześnie, skracając czas reakcji z godzin do minut (na CrowdStrike).
- Inne nowe przechwyty oprogramowania kod open source zanim zdąży uruchomić się i rozprzestrzenić w firmie.
- CrowdStrike twierdzi, że liczba agentów AI przewyższa obecnie liczbę personelu 90 do 1.
💡 Dlaczego powinno Cię to obchodzić?
Ponieważ atakujący poruszają się teraz szybciej, niż jakikolwiek człowiek jest w stanie zareagować, firmy mają wreszcie realną szansę naping w górę — pod warunkiem CrowdStrikeNarzędzia firmy działają zgodnie z opisem.
⚡ Ameryka odwraca się od centrów danych AI
Krótkie podsumowanie:
Centra danych AI stały się punktem zapalnym w polityce. Około siedmiu na dziesięciu Amerykanów nie chce, aby takie centra były budowane w ich pobliżu, a obie partie sprzeciwiają się temu. Nowy Jork i Teksas wstrzymały się, a sprzeciw zaczyna wpływać na sposób, w jaki będzie budowana AI.
- A Badanie Gallupa znaleziono 71% Amerykanów sprzeciwia się budowie centrum danych w pobliżu swojego domu, 48% stanowczo się sprzeciwiam.
- W lipcu w Nowym Jorku uruchomiono ogólnokrajową pierwsze moratorium stanowe, wstrzymując na rok budowę nowych centrów danych o dużej skali (50 MW i większych).
- Teksas wtedy wstrzymano nowe zatwierdzenia w oczekiwaniu na audyt — choć krytycy nazywają to teatrem roku wyborczego.
- Senatorowie Sanders i Ocasio-Cortez przedstawili projekt ustawy federalnej wstrzymać budowę nowych centrów danych AI do czasu wprowadzenia zasad bezpieczeństwa.
- Agencja Ochrony Środowiska (EPA) proponuje obecnie zniesienie rząd federalny wymaganie publicznych komentarzy na temat pozwoleń na emisję zanieczyszczeń do powietrza w centrach danych.
💡 Dlaczego powinno Cię to obchodzić?
Centra danych zasilające Twoje narzędzia AI obciążają lokalne sieci energetyczne, zasoby wody i rachunki za media. Niezależnie od tego, czy będą się one nadal rozrastać, czy też staną w miejscu, pomoże to ukształtować przyszłość AI.
🫀 Sztuczna inteligencja wykrywa ukryte choroby serca w dwie sekundy
Krótkie podsumowanie:
Naukowcy z Imperial College London stworzyli sztuczną inteligencję, która odczytuje rutynowe EKG w mniej niż dwie sekundy i wykrywa objawy niewydolności serca i choroby zastawkowej, których lekarze nie widzą na tym samym trace. Trwają badania kliniczne w ramach NHS.
- Zostało to wyszkolone 10.6 milionów EKG, a następnie testowane na około 67,000 Pacjenci z USA podzieleni na dwie grupy.
- Łapie 81% przypadków niewydolności serca i do 90% przypadków wad zastawkowych.
- Badania EKG są tanie i powszechne — każdego roku wykonuje się ich około miliarda na całym świecie.
- Testowanie jest teraz uruchomione 590 pacjentów NHS w sześciu szpitalach w Londynie i Bristolu.
- Rutynowe stosowanie w ramach NHS prawdopodobnie nastąpi za około dwa lata, po uzyskaniu niezbędnych zezwoleń.
💡 Dlaczego powinno Cię to obchodzić?
Badanie, które już wykonałeś, może pomóc wykryć chorobę serca na wczesnym etapie, przyspieszając leczenie i skracając wielomiesięczny czas oczekiwania na badania.
🧠 Operacja mózgu wspomagana sztuczną inteligencją na żywo ratuje wzrok mężczyzny
Krótkie podsumowanie:
W Londynie chirurdzy usunął guz mózgu, podczas gdy AI oglądała transmisję wideo na żywo, wskazując w czasie rzeczywistym nerwy i naczynia krwionośne, których należy unikać. Pacjent zachował wzrok, a lekarze nazywają to światowym przełomem.
- Sztuczna inteligencja analizowała obraz z kamery chirurgicznej na żywo — nie skany przedoperacyjne — i oznaczała obszary, których należy unikać.
- Rhys Hibbert, mający wówczas 48 lat, miał 11mm guz przysadki mózgowej wykryty po pierwszym ataku padaczkowym w grudniu 2024 r.
- Chirurdzy przeprowadzali operację przez nos, podczas gdy AI działała na oddzielnym monitorze, pełniąc funkcję przewodnika.
- System był przeszkolony na setkach poprzednich operacji — więcej niż większość chirurgów wykonuje przez całe życie.
- Po około tygodniu pacjent odzyskał wzrok; przypadek ten jest częścią trwającego badania klinicznego.
💡 Dlaczego powinno Cię to obchodzić?
Dla pacjentów oznacza to bezpieczniejsze operacje, z fachową „drugą parą oczu”, która wychwyci zagrożenia, które chirurg mógłby przeoczyć. Człowiek pozostaje przy sterach – na razie AI jedynie doradza.
🤖 Anthropic zlecił Claude przeprowadzenie własnych badań nad bezpieczeństwem
Krótkie podsumowanie:
Ostatnia Badanie antropiczne Zlecił agentom Claude przeprowadzenie badań bezpieczeństwa na własną rękę. Sztuczna inteligencja zbadała 10 rodzajów niewłaściwego zachowania – od pochlebstwa po hakowanie nagród – i dla każdego z nich znalazła rozwiązania, które poprawiły bezpieczeństwo bez uszczerbku dla innych możliwości modelu.
- Claude zajął się każdą wadą od początku do końca — przeszukał literaturę, zaproponował metody, przeprowadził szkolenia i przeprowadził testy.
- Poprawki zostały zamknięte pomiędzy 26% oraz 96% każdej „luki bezpieczeństwa” (odległości między obecnym wynikiem a idealnym punktem odniesienia).
- W przypadku oszustwa Claude zmniejszył różnicę, 85% średnio, w porównaniu 20% dla sześciu doświadczonych badaczy.
- Słabszy Claude Sonnet 5 wziął 60 godzin aby ulepszyć wersję przedpremierową Opus 4.8, używając około 15,000x mniej danych niż zwykle wykorzystuje Anthropic.
- Anthropic zauważa, że porównanie do człowieka nie jest sprawiedliwe, gdyż ludzie nie potrafią iterować, a testom poddano jedynie wąski zakres wad.
💡 Dlaczego powinno Cię to obchodzić?
Automatyzacja badań nad bezpieczeństwem mogłaby pomóc nadzorowi nadążać za postępem sztucznej inteligencji — ale do tego potrzebne będzie prawdziwe zaufanie, oparte na wynikach, które sama firma Anthropic starannie kwestionuje.
Hej! Jestem Krishna Szczebel
Założyciel Guru99.com, Redaktor naczelny i ekspert ds. technologii
Czy ten e-mail został do Ciebie przesłany? Zarejestruj się za darmo tutaj.

