W piątek Microsoft uruchomił na swojej platformie Foundry Microsoft-Decision-1, wyspecjalizowany model szybkiego, ustrukturyzowanego podejmowania decyzji, zbudowany na otwartym Qwen3.5-9B firmy Alibaba, a nie na jakimkolwiek modelu jej bliskiego partnera OpenAI, podaje The New Stack.
Premiera nastąpi trzy dni po udostępnieniu przez OpenAI swojego API Decisions każdemu programiście w publicznej wersji beta i tego samego dnia TypeSafe, startup, który około trzy i pół tygodnia temu zapoczątkował kategorię modeli decyzyjnych wraz z Jevem, ogłosił serię A o wartości 870 milionów dolarów przy wycenie 7,5 miliarda dolarów, na czele której stoi a16z. Microsoft wycenił Decyzję-1 dokładnie po stawce Jeva: 0,042 dolara za milion tokenów wejściowych z bezpłatnym wyjściem. Więcej informacji na temat przyspieszającego wyścigu o to, by sztuczna inteligencja była tańsza i szybsza, znajdziesz w naszych bieżących reportażach z branży AI.
Wyceniony na miarę Jeva, zbudowany na otwartych ciężarach rywala
Decyzja-1 to model po wyszkoleniu: Microsoft zaczął od Qwen3.5-9B firmy Alibaba i dostroił go pod kątem zadań związanych z podejmowaniem ustrukturyzowanych decyzji, a nie generowania otwartego. Firma twierdzi, że planuje ponownie oprzeć model na własnych modelach MAI, a także OpenAI, ale początkowy wybór chińskiej bazy typu open-weight jest godny uwagi w przypadku firmy, która inwestuje miliardy w OpenAI.
Microsoftowi także daleko do pioniera. Według The New Stack w ciągu trzech i pół tygodnia od uruchomienia Jeva OpenAI, Upstage, Perplexity, Cloudflare i AWS dostarczyły własne modele decyzyjne. Wybrana przez Microsoft baza Qwen3.5 stała się czymś w rodzaju standardu branżowego: wiceprezes ds. inżynierii firmy Cognition, Jared Palmer, wydał około 95 dolarów na obliczenia Modal H100, przenosząc swoje modele Kev typu open source do Qwen3.5, a Cloudflare zbudował swój model Clef-flash na tej samej bazie Qwen3.5-9B.
Cena też jest zbieżna. Palmer umieszcza Kev-4B na OpenRouter po cenie 0,042 dolara za milion tokenów wejściowych, Perplexity pobiera opłatę w wysokości 0,02 dolara, a OpenAI pobiera ponad dwukrotnie wyższą stawkę Jeva. Przy tych cenach przychody z indywidualnych wywołań decyzyjnych są minimalne, co sugeruje, że większą szansą Microsoftu jest utrzymanie ruchu agentów, w tym wywołań generatywnych związanych z każdą decyzją, w ramach Foundry.
Microsoft jest swoim pierwszym klientem
Prezes i dyrektor generalny Microsoft, Satya Nadella, ogłosił model w piątek w X, pisząc, że decyzja-1 „zapewnia najwyższą wydajność w przypadku ustrukturyzowanych zadań decyzyjnych, przewyższając zarówno LLM, jak i inne modele decyzyjne pod względem opóźnień i jakości” i dodał: „Już testujemy go w całej firmie Microsoft”.
Według The New Stack potwierdziły to cztery wewnętrzne zespoły. Zespół badawczy Xbox wykorzystał decyzję-1 do zebrania ponad 10 000 opinii graczy. Zespół Copilot oceniał za jego pomocą odpowiedzi na czacie i agentów. Inżynierowie dyżurni używali go do pobierania kontekstu podczas incydentów na żywo, a Microsoft Discovery wykorzystywał go do oceniania eksperymentów przed ponownym zaplanowaniem przez agenta.
Jak wynika z wewnętrznych danych Microsoftu, model ten jest ponad 14 razy szybszy niż GPT-6 Sol przy ułamku kosztów w przypadku obciążenia Xbox i 46 razy bardziej spójny w Discovery. Achint Srivastava, wiceprezes ds. inżynierii oprogramowania w biurze CTO firmy Microsoft, przedstawił Decyzję-1 jako sposób na dodanie możliwości podejmowania decyzji do istniejących aplikacji, agentów i przepływów pracy „w bezpiecznym, zaufanym środowisku”.
Czego nie można zrobić w decyzji-1
Premiera pokazuje także, gdzie Microsoft dogania rywali. Lista Foundry firmy Decision-1 podaje, że akceptuje do 32 768 tokenów tekstu i zwraca JSON, ale nie obsługuje obrazów — w przeciwieństwie do API decyzji OpenAI i Clef firmy Cloudflare, które korzystają z kodera wizyjnego. I chociaż Cloudflare wypuściło Clefa na liberalnej licencji Apache 2.0, Microsoft nie ogłosił otwartych wag dla Decyzji-1.
Istnieje również kwestia kompatybilności. AWS, Upstage i Ollama przyjęły interfejs API System One firmy TypeSafe, obecnie wspólny interfejs w całej kategorii, ale Microsoft nie powiedział, czy decyzja-1 jest w pełni kompatybilna — chociaż jego przykładowy kod Foundry wywołuje punkt końcowy /systemone.
Twierdzenia dotyczące kalibracji również zasługują na analizę. Microsoft twierdzi, że prawdopodobieństwa Decyzji-1 są skalibrowane, co oznacza, że 90% prognoza powinna być trafna w około dziewięciu przypadkach na dziesięć w reprezentatywnych przypadkach, a własna dokumentacja firmy zaleca klientom sprawdzenie kalibracji na swoich danych. Ta przestroga nawiązuje do wstępnego druku JevOut, w którym badacz informatyki z USC, Zixiang Xu i współautorzy, odkryli, że krótkie, naturalnie brzmiące dodatki do kontekstu zmieniły 312 z 508 początkowo poprawnych decyzji Jeva, a w 229 przypadkach Jev przypisał błędnej odpowiedzi co najmniej 70% prawdopodobieństwa. Trzy inne systemy punktacji wykazały współczynniki odwrócenia od 64,9% do 73,2% przy tym samym podejściu testowym. Microsoft twierdzi, że przetestował Decyzję-1 z ośmioma rodzajami zakłóceń, w tym ze zmienioną kolejnością opcji i sparafrazowanymi opisami.
Decyzje dotyczące kierowania między Copilotem, GitHubem i Xboxem
Modelka może mieć przed sobą większe zadanie. W środę Microsoft powiedział, że GitHub Copilot wkrótce zdecyduje, kiedy uruchomić zadanie na urządzeniu, a kiedy wysłać je do modeli w chmurze, choć nie ujawnił, co Copilot wysyła do chmury. Routing modelu jest jednym z przypadków użycia, które Microsoft wymienia dla Decyzji-1, ale firma nie potwierdziła, że model będzie wykonywał te wywołania. Decyzje dotyczące routingu podejmowane w Copilot, GitHub i Xbox sprawiają, że Microsoft ma motywację do zajmowania się nimi we własnym zakresie.
Konkurencja jest widoczna w przyczepności TypeSafe. Dyrektor generalny TypeSafe, Diogo Almeida, napisał w X, że „29,4% osób z listy Fortune 500 pojawiło się” w ciągu trzech tygodni od premiery Jeva, że model „przypadkowo obsługiwał biliony tokenów dziennie” oraz, mając na uwadze obciążenie swojego zespołu pracą, że „minęły już 3 tygodnie, a chcielibyśmy teraz spać”. Są to te same przedsiębiorstwa, którym Microsoft sprzedaje platformę Azure — co sprawia, że pojawienie się Decyzji-1 nie oznacza stawiania na nowy rynek, a raczej obronę istniejącego.
---
Wyprzedź sztuczną inteligencjęOtrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.
Przeczytaj więcej aktualności o sztucznej inteligencji →

