การเริ่มต้น AI ใหม่ที่ก่อตั้งโดยอดีตนักวิจัย OpenAI ได้เปิดตัวสิ่งที่เรียกว่าโมเดลระดับใหม่ทั้งหมด ซึ่งเป็นโมเดลที่ไม่สามารถเขียนเรียงความให้คุณได้ และบอกว่านั่นคือประเด็นที่แท้จริง

TypeSafe AI ประกาศเมื่อวันอังคารที่เปิดตัว "System One Model" ตัวแรกชื่อ Jev ซึ่งพร้อมให้เข้าถึงได้ทันทีในช่วงทดลอง บริษัทนี้ก่อตั้งโดย Diogo Almeida ซึ่งกล่าวว่างานวิจัยเบื้องหลังการสอนตามคำสั่งของ ChatGPT มาจากงานที่เขามีส่วนร่วมที่ OpenAI หลังจากซ่อนตัวมาเป็นเวลาสองปี เขาแย้งว่าการที่อุตสาหกรรมมุ่งเน้นไปที่การแชทนั้นได้ปิดบังจุดที่ระบบอัตโนมัติล้มเหลวจริงๆ For more context on this story, see our ongoing breaking AI news.

"โมเดลเป็นมนุษย์เหนือมนุษย์ในการสนทนามานานหลายปี แล้วระบบอัตโนมัติทั้งหมดอยู่ที่ไหน" อัลเมดาเขียนไว้ในโพสต์เปิดตัว “นั่นเป็นคำถามที่ขับเคลื่อนฉันมาตลอดสี่ปีที่ผ่านมา”

จริงๆ แล้วโมเดล 'System One' คืออะไร

ชื่อนี้ได้ยืมมาจากความแตกต่างทางจิตวิทยาระหว่างการคิดอย่างรวดเร็วตามสัญชาตญาณกับการให้เหตุผลอย่างช้าๆ โดยเจตนา ในกรณีที่โมเดลภาษาขนาดใหญ่สร้างโทเค็นข้อความด้วยโทเค็น — ยืดหยุ่น ทั่วไป และมีแนวโน้มที่จะไร้สาระเป็นครั้งคราว Jev ของ TypeSafe ถูกสร้างขึ้นเพื่อทำบางสิ่งที่แคบกว่า: ใช้สถานะที่ไม่มีโครงสร้างในขณะที่พิมพ์อินพุตและส่งคืน การตัดสินใจที่มีโครงสร้างพร้อมแนบความน่าจะเป็นที่ปรับเทียบแล้ว

บริษัท อธิบายว่า Jev เป็น "การเรียกใช้ฟังก์ชันชายแดน - สติปัญญา: สถานะที่ไม่มีโครงสร้างใน, พิมพ์การตัดสินใจที่น่าจะเป็นออก" เนื่องจากผลลัพธ์ที่เป็นไปได้ถูกกำหนดไว้ล่วงหน้าและโมเดลไม่เคยสร้างสตริงรูปแบบอิสระ TypeSafe อ้างว่าไม่สามารถสร้างข้อผิดพลาดประเภทได้ ซึ่งเป็นคุณสมบัติที่บริษัทกล่าวว่ารับประกันทางคณิตศาสตร์มากกว่าที่จะเป็นไปได้ทางสถิติ และไม่สามารถทำให้เกิดอาการประสาทหลอนในแบบที่โมเดลสร้างข้อความสามารถทำได้

สถาปัตยกรรมแยกจากแนวทางปฏิบัติหลักในสามวิธี ตามโพสต์เปิดตัว: สถาปัตยกรรมโมเดลใหม่ ตัวเก็บตัวอย่างแบบขนานที่สร้างเอาต์พุตทั้งหมดในแบบสอบถามเดียวแทนที่จะเรียงตามลำดับ และวิธีการฝึกอบรมที่บริษัทเรียกว่า Reinforcement Learning for Calibrated Decisions (RLCD) ซึ่งปรับให้เหมาะสมสำหรับความน่าจะเป็นที่ซื่อสัตย์แบบญาณ แทนที่จะเป็นการตั้งค่าของมนุษย์หรือผลลัพธ์ที่ตรวจสอบได้ทางโปรแกรม

การเรียกร้อง: เร็วขึ้น 100 เท่า ต้นทุนเพียงเล็กน้อย

ตัวเลขที่ TypeSafe เผยแพร่นั้นรุนแรง บริษัทกล่าวว่า Jev มอบข้อมูลอัจฉริยะที่เทียบเคียงได้กับ LLM ระดับแนวหน้าที่มีอยู่ ในสิ่งที่เรียกว่างาน "รูปแบบ System One" ซึ่งได้แก่ การจัดหมวดหมู่ การกำหนดเส้นทาง การให้คะแนน การสกัด และการแยกสาขา ในขณะที่ตอบสนองใน 70 ถึง 500 มิลลิวินาที เทียบกับเวลาตอบสนองตั้งแต่ต้นทางถึงปลายทางที่ 3 ถึง 329 วินาทีสำหรับรุ่นแนวหน้า ซึ่งทำงานได้เร็วกว่าถึง 40x ถึง 200x บริษัทกล่าว

การกำหนดราคาก็แหวกแนวเช่นเดียวกัน: 0.042 เหรียญสหรัฐต่อโทเค็นอินพุตหนึ่งล้านโทเค็น โดยที่ไม่มีโทเค็นเอาต์พุต เนื่องจากเอาต์พุตจะถูกคำนวณแบบขนานแทนที่จะสร้างโทเค็นด้วยโทเค็น บริษัทรับทราบในโพสต์ว่ายังไม่สามารถพิสูจน์ได้ว่าการกำหนดราคามีความยั่งยืนในวงกว้าง

“คำกล่าวอ้างที่ไม่ธรรมดาจำเป็นต้องมีหลักฐานพิเศษ” โพสต์ดังกล่าวอ่าน ก่อนที่จะเสนอหลักฐานที่มี

ใบเสร็จรับเงิน — และสิ่งที่คนขี้ระแวงพูด

TypeSafe เผยแพร่การสาธิตแบบเคียงข้างกันโดยเปรียบเทียบระหว่าง Jev กับ GPT-5.6 Terra ซึ่งอธิบายว่าเป็นโมเดลชายแดนที่เทียบเคียงได้มากที่สุดในระดับสติปัญญาที่คล้ายคลึงกัน และกล่าวว่าความขัดแย้งเพียงอย่างเดียวในการดำเนินการที่บันทึกไว้เกี่ยวข้องกับการตัดสินที่คลุมเครืออย่างแท้จริง นอกจากนี้ยังแนะนำวิธีการ "ประเมินเวิร์กโฟลว์" แบบใหม่ที่ใช้วัดแบบจำลองโดยเทียบกับมติของโมเดลภายนอกที่ใหญ่ที่สุด เช่น Astra ของ OpenAI และ Fable ของ Anthropic ภายในกราฟคำนวณคงที่ และอ้างว่า Jev "เป็นเจ้าของเขตแดน Pareto สำหรับขนาดเกือบ 2 ลำดับความสำคัญ"

โดยเฉพาะอย่างยิ่ง บริษัทได้ตีพิมพ์โพสต์ชื่อ "antibenchmaxxing" ซึ่งอธิบายว่าทำไมบริษัทจึงหลีกเลี่ยงการวัดประสิทธิภาพแบบดั้งเดิม โดยให้เหตุผลว่าแบบจำลองที่ออกแบบมาสำหรับการตัดสินใจที่มีโครงสร้างภายในเวิร์กโฟลว์ซอฟต์แวร์นั้นต่อต้านการเปรียบเทียบระดับโลกที่มีความหมาย

ปฏิกิริยาต่อ Hacker News ซึ่งการเปิดตัวได้รับคะแนนหลายร้อยคะแนนภายในไม่กี่ชั่วโมง มีตั้งแต่ความตื่นเต้นอย่างแท้จริงไปจนถึงความกังขา ผู้แสดงความคิดเห็นหลายคนตั้งข้อสังเกตว่าหลักฐานสาธารณะประกอบด้วยวิดีโอสาธิตเป็นส่วนใหญ่ รวมถึงวิดีโอหนึ่งที่แสดงโมเดลที่ขับเคลื่อนลูปการเล่นเกม Doom แทนที่จะเป็นการประเมินโดยบุคคลที่สามที่ทำซ้ำได้ คนอื่นๆ แย้งว่าวิธีนี้เป็นที่เข้าใจได้ดีที่สุดว่าเป็นตัวแยกประเภทที่มีคุณภาพระดับแนวหน้าที่รวดเร็วและมีประโยชน์มาก ซึ่งมีประโยชน์สำหรับภาระงานบางส่วน แทนที่จะมาแทนที่ LLM

แม้แต่ผู้สังเกตการณ์ที่เห็นอกเห็นใจก็ยังวางกรอบภาระการพิสูจน์ไว้อย่างชัดเจน “ใช่ พวกเขาพูดเหมือนคนขี้ระแวง แต่ไม่มีหลักฐานมากมาย นอกเหนือจากวิดีโอสาธิตสองสามรายการ” ผู้แสดงความคิดเห็นคนหนึ่งเขียน "การสาธิตสดน่าจะน่าเชื่อถือกว่านี้มาก"

ทำไมมันถึงมีความสำคัญอยู่ดี

สนามเข้าสู่จุดที่เจ็บปวดอย่างแท้จริง ส่วนแบ่งขนาดใหญ่ของการเรียก LLM ที่ใช้งานจริงในซอฟต์แวร์เชิงพาณิชย์ไม่ได้เกิดขึ้นเลย - เป็นการตัดสินแบบไบนารี การกำหนดหมวดหมู่ และการตัดสินใจกำหนดเส้นทางที่ห่อหุ้มด้วยร้อยแก้ว หากโมเดลสามารถทำการเรียกเหล่านั้นด้วยความมั่นใจที่ปรับเทียบแล้วที่ 70 มิลลิวินาทีและต้นทุนเอาท์พุตเป็นศูนย์อย่างมีประสิทธิภาพ ความประหยัดของซอฟต์แวร์ที่ขับเคลื่อนด้วย AI จะเปลี่ยนไปอย่างมาก: ส่วนต่อประสานผู้ใช้แบบเรียลไทม์กลายมาใช้งานได้จริง และขั้นตอนไปป์ไลน์ที่แพงเกินกว่าจะทำให้เป็นอัตโนมัติด้วย LLM ก็มีราคาถูกพอที่จะรันได้ทุกที่

กรณีการใช้งานที่แนะนำของ TypeSafe ได้แก่ การจัดประเภทและการกำหนดเส้นทางข้อมูล การตรวจสอบและการป้องกันเอาต์พุต LLM การตรวจจับการเจลเบรก และการวิเคราะห์การลดแผนที่บนชุดข้อมูลขนาดใหญ่ — เวิร์กโหลดที่โค้ดโดยรอบสามารถจำกัดเสรีภาพของโมเดลและตรวจจับข้อผิดพลาดได้

บริษัทเปิดเผยอย่างตรงไปตรงมาเกี่ยวกับคำถามปลายเปิด: การประเมินที่เผยแพร่เผยแพร่นั้นดำเนินการจากแล็ปท็อปบนชายฝั่งตะวันตกของสหรัฐอเมริกา และความยั่งยืนด้านราคาในระยะยาวยังคงไม่ได้รับการพิสูจน์ การที่หน่วยข่าวกรองของ Jev อ้างว่ารอดจากการติดต่อกับการทดสอบอิสระหรือไม่ จะเป็นตัวกำหนดว่า "System One Models" จะกลายเป็นหมวดหมู่หรือเป็นเรื่องที่น่าสงสัยหรือไม่

ขณะนี้เปิดให้เข้าถึงก่อนใครได้แล้วผ่านทางเว็บไซต์ของบริษัท

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →