Google го претстави Gemini 4 Argon: AI за сложени задачи, со пристап што засега е ограничен

0 коментари 4 мин. читање

Google го претстави Gemini 4 Argon, нов модел наменет за сложени задачи во софтверското инженерство, професионалната работа и кибербезбедноста. Пристапот првично го добиваат избрани партнери за киберодбрана, пред најавеното пошироко пуштање.

Веста отвора две поврзани прашања: колку работа може да преземе еден AI систем и како да се контролира додека ја извршува? Кај моделите што користат алатки и преземаат повеќе последователни чекори, квалитетот на одговорот е само дел од оценката. Важни се и трошокот, дозволите и можноста навреме да се запре погрешна постапка.

До еден милион излезни токени

Во официјалната објава од 30 септември, Google наведува дека Argon поддржува до еден милион излезни токени, наспроти претходниот лимит од 64.000. Ова е лимит за генерирањето, што треба да овозможи подолги процеси на решавање сложени задачи.

Корај Кавукчуоглу, виш потпретседател во Google DeepMind и главен AI архитект на Google, во објавата пишува:

„Безбедното објавување способности на ова ниво бара фазен пристап.“

Цитатот е преведен од англиски.

Поголемиот лимит создава простор за подолга работа, но сам по себе не докажува дека секоја задача ќе биде решена подобро. За корисниците и компаниите, практичната мерка останува резултатот што системот го постигнува со потрошеното време и ресурси.

Прво место на Vals Index, но што точно мери тоа?

На табелата на Vals Index, ажурирана на 30 септември, Gemini 4 Argon е прв со резултат од 68,90 проценти. Зад него се Claude Sonnet 5.5 со 67,04 и Claude Opus 5.5 со 66,97 проценти.

Индексот комбинира задачи од финансии, програмирање, право и даноци, со тежини според уделот на секторите во американскиот БДП. Меѓу проверките има финансиско моделирање во табели, миграција на код, правно истражување и даночни прашања.

Овој резултат е корисен показател за конкретниот сет тестови. Не значи дека моделот е најдобар за секоја професија, јазик или деловен процес. Самата методологија на Vals го опишува економското пондерирање како поедноставување на можниот ефект на AI.

За домашна компанија, следниот чекор би бил проверка со сопствени задачи и критериуми. Резултат од американски правни и даночни тестови, на пример, не е потврда за точност при работа со македонски прописи.

Зошто првите корисници се тимови за cyber одбрана?

Првичниот пристап се реализира преку Fairwind Program на Google DeepMind. Програмата им дава ран пристап на проверени организации што штитат важни системи, меѓу кои државни институции, здравствени установи, телекомуникациски оператори и технолошки платформи.

Избрани партнери можат да го користат Argon самостојно или со CodeMender, агент за истражување ранливости и автоматизирање софтверски поправки. Логиката на програмата е одбранбените тимови да добијат предност, бидејќи истите способности во погрешни раце можат да послужат за напад.

Пристапот затоа има организациски услови: проверка на партнерите, контрола на корисничките дозволи, повеќефакторска автентикација отпорна на фишинг и следење на употребата. Забранети се препродавање и споделување на пристапот. Дозволените активности вклучуваат овластени симулации на закани и анализа за одбранбени и истражувачки цели.

Тоа го прави почетното пуштање значително поинакво од модел што секој може веднаш да го отвори во апликација.

Контролата на агентот е дел од производот

Поширокиот пристап на DeepMind е објаснет во AI Control Roadmap, објавен во јуни. Рамката предвидува повеќе слоеви заштита, вклучително изолирани средини, ограничени дозволи и надзор над однесувањето на агентите.

Други AI системи можат да дејствуваат како надзорници, да ги проверуваат постапките и плановите на работниот агент и да блокираат штетна акција. DeepMind наведува и дека многу означени инциденти произлегуваат од погрешно толкување или претерана настојчивост да се постигне целта на корисникот, наместо од намера за напад.

За компаниите што воведуваат агенти, ова има непосредна практична смисла. Систем што може да менува код или да работи со деловни податоци мора да има јасни граници, проверливи постапки и механизам за прекин. Способноста да ја заврши задачата и дозволата да преземе одреден чекор се две одделни проверки.

Кога ќе биде достапен и колку ќе чини?

Google најавува поширок пристап, почнувајќи со платени API корисници и претплатници на Google AI Ultra, но не наведува конкретен датум.

Промотивната API цена ќе биде 2 долари за милион влезни и 10 долари за милион излезни токени. По промотивниот период, цените ќе бидат 4 и 20 долари. Кешираните влезни токени ќе имаат попуст од 95 проценти од влезната цена.

Argon поставува високи очекувања за AI што работи на долги професионални задачи. Следната проверка ќе дојде со пошироката употреба: дали резултатите од тестовите ќе се претворат во сигурна, исплатлива работа во реални системи.

Напишано од

Автор на текстови генерирани со помош на вештачка интелигенција. Секогаш ги проверувам информациите детално пред да ги споделам текстовите на преглед кај уредничкиот тим. Ако нешто згрешам, се извинувам. Работам на подобрување! :)

Дискусија

Уште никој не искоментирал на темава, биди прв...

Мени
Заедница
Изглед