แชทบอท AI ชั้นนำให้คำตอบที่ผิดสำหรับคำถามทางการเงินบ่อยกว่านั้น ตามรายงานการวิจัยใหม่โดย UK fintech Saturn ที่ทดสอบโมเดล AI ที่ได้รับความนิยมสูงสุด 18 โมเดล และพบอัตราข้อผิดพลาดเฉลี่ย 57% Financial Times รายงานเมื่อวันจันทร์

รายงานชื่อ "หน่วยงานประดิษฐ์" มาถึงในขณะที่ผู้บริโภคหลายล้านคนหันมาใช้แชทบอทมากขึ้นเพื่อขอคำแนะนำเกี่ยวกับเงินบำนาญ ภาษี หนี้ และการออม ซึ่งเป็นคำถามที่คำตอบที่ผิดเพียงคำตอบเดียวสามารถก่อให้เกิดผลทางการเงินที่แท้จริงได้ เนื่องจากผู้ช่วยทั่วไปถูกผลักดันเข้าสู่ขอบเขตการควบคุม การศึกษาในลักษณะนี้กำลังกลายเป็นการทดสอบความเครียดที่เกิดขึ้นซ้ำๆ เกี่ยวกับคำมั่นสัญญาของผู้บริโภคในอุตสาหกรรม และเราจะติดตามการพัฒนา AI ล่าสุดต่อไปในขณะที่หน่วยงานกำกับดูแลตอบสนอง

การทดสอบทำงานอย่างไร

ทีมโดเมนของ Saturn ได้ใส่โมเดล AI ที่ใช้กันอย่างแพร่หลายที่สุด 18 โมเดลผ่านคำถาม 121 ข้อ ซึ่งครอบคลุมเรื่องเงินบำนาญ ภาษี หนี้ และการออม ซึ่งเป็นประเด็นหลักที่ผู้บริโภครายย่อยมักขอคำแนะนำมากที่สุด แบบจำลองที่ทดสอบ ได้แก่ ChatGPT, Gemini, Claude และ Copilot ของ Microsoft ตามรายงานสรุปที่เผยแพร่ในรายงาน

โดยเฉลี่ยแล้ว แบบจำลองเหล่านี้ทำผิดพลาด 57% ของเวลาทั้งหมด ดาวเสาร์กล่าว บริษัทตีกรอบการค้นพบนี้ครอบคลุม "ข้อผิดพลาดเกี่ยวกับความล้มเหลวในการคุ้มครองผู้บริโภค" และใช้สิ่งเหล่านั้นเพื่อโต้แย้งว่าช่องว่างคำแนะนำของสหราชอาณาจักร — ช่องว่างระหว่างผู้ที่สามารถเข้าถึงคำแนะนำทางการเงินที่ได้รับการควบคุมและผู้ที่ไม่สามารถทำได้ — จะไม่ถูกปิดโดยแชทบอทที่ไม่ได้รับการควบคุมเพียงอย่างเดียว

แม้แต่รุ่นที่ดีที่สุดก็ผิดพลาดบ่อยครั้ง

ผลลัพธ์ที่ได้ไม่สม่ำเสมอ แต่แม้แต่ผู้ที่แข็งแกร่งที่สุดก็ล้มเหลวบ่อยครั้ง ตามรายงานของ FT โมเดลที่มีประสิทธิภาพดีที่สุดคือ Claude Opus 5 ของ Anthropic ที่ทำงานในโหมดการใช้เหตุผล และยังคงทำผิดพลาดใน 39% ของคำตอบ

รายละเอียดดังกล่าวอาจพิสูจน์ได้ว่าเป็นการค้นพบที่เป็นผลสืบเนื่องที่สุดของรายงาน โหมดการใช้เหตุผล ซึ่งให้แบบจำลองพิจารณาก่อนตอบ เป็นคำตอบชั้นนำของอุตสาหกรรมสำหรับอาการประสาทหลอนและข้อผิดพลาด และแบบจำลองขอบเขตมักให้ผลลัพธ์ที่ดีในการสอบวิชาชีพในด้านการเงินและกฎหมาย อัตราข้อผิดพลาด 39% สำหรับคำถามทางการเงินเชิงปฏิบัติ บ่งชี้ว่าเกณฑ์มาตรฐานในรูปแบบการสอบและข้อความค้นหาของผู้บริโภคในโลกแห่งความเป็นจริงวัดผลสิ่งต่าง ๆ กันมาก

การค้นพบนี้ยังดึงการตอบโต้อีกด้วย ผู้แสดงความคิดเห็นใน Hacker News ตั้งคำถามถึงวิธีการและการเลือกโมเดล โดยสังเกตว่าตัวอย่างข้อผิดพลาดหลายรายการในรายงานมาจากโมเดลฟรีเทียร์ที่มีขนาดเล็กกว่า แต่ตัวเลขโดยเฉลี่ย 57% และตัวเลขที่ดีที่สุดในระดับเดียวกัน 39% ถือเป็นคำกล่าวอ้างที่เผยแพร่จาก Saturn และ FT และคำเตือนกลางของรายงานที่ว่าผู้บริโภคไม่ควรถือว่าเอาต์พุตแชทบอทเป็นคำแนะนำที่ได้รับการควบคุมนั้น ก็ไม่มีข้อโต้แย้ง

คำเตือนที่หน่วยงานกำกับดูแลเคยได้ยินมาก่อน

รายงานดังกล่าวเกิดขึ้นท่ามกลางความกังวลอย่างเป็นทางการที่เพิ่มขึ้นเกี่ยวกับแชทบอทในเรื่องการเงิน ผู้บริโภคในสหราชอาณาจักรได้รับคำเตือนแล้วเกี่ยวกับแชทบอท AI ที่ให้คำแนะนำทางการเงินที่ไม่ถูกต้องในการแจ้งเตือนที่ครอบคลุมอย่างกว้างขวางซึ่งเผยแพร่โดย The Guardian ในช่วงปลายปี 2025 และหน่วยงานกำกับดูแลทางการเงินทั่วยุโรปและสหรัฐอเมริกาได้ทำเครื่องหมายว่าคำแนะนำที่สร้างโดย AI นั้นเป็นพื้นที่ที่มีความเสี่ยงของผู้บริโภคที่เกิดขึ้นใหม่

จุดยืนของ Saturn ทำให้รายงานมีความได้เปรียบเป็นพิเศษ: บริษัทพัฒนาเครื่องมือ AI สำหรับคำแนะนำทางการเงิน และเผยแพร่การค้นพบนี้ไม่ใช่เป็นการปฏิเสธ AI ในด้านการเงิน แต่เป็นกรณีของการทำให้รั้วถูกต้อง ข้อโต้แย้งคือแชทบอตที่ได้รับการควบคุมไม่ดีกำลังเติมเต็มช่องว่างคำแนะนำโดยค่าเริ่มต้น และตัวเลือกที่หน่วยงานกำกับดูแลต้องเผชิญคือระหว่างคำแนะนำ AI ที่ได้รับการดูแลและคำแนะนำ AI ที่ไม่มีผู้ดูแล ไม่ใช่ระหว่าง AI กับคำแนะนำของมนุษย์

การมีส่วนร่วมของ Saturn ในการอภิปรายดังกล่าวเป็นการโต้แย้งเกี่ยวกับการออกแบบนโยบาย: บริษัทกล่าวว่าการเปลี่ยนจากสิ่งที่เรียกว่ากฎระเบียบที่มากเกินไปไปสู่การวางรั้วที่ใช้งานได้จริงในแบบจำลองภาษาขนาดใหญ่จะช่วยลดช่องว่างคำแนะนำได้เร็วขึ้นในขณะที่ปกป้องผู้คนจากคำแนะนำ AI ที่ไม่ได้รับการควบคุม กล่าวอีกนัยหนึ่ง แทนที่จะไม่ให้ AI ไม่ได้รับคำแนะนำทางการเงินโดยสิ้นเชิง ให้สร้างการใช้งานที่มีการควบคุมดูแลและจำกัด ซึ่งสามารถให้บริการลูกค้าได้อย่างปลอดภัยซึ่งที่ปรึกษาที่เป็นมนุษย์มีราคาแพงเกินกว่าจะเข้าถึงได้

การวางกรอบนั้นมีความสำคัญเนื่องจากช่องว่างคำแนะนำเป็นเหตุผลที่แข็งแกร่งที่สุดของอุตสาหกรรมในการอยู่ในพื้นที่นี้เลย ในสหราชอาณาจักร ครัวเรือนส่วนใหญ่อยู่นอกเกณฑ์ที่คำแนะนำทางการเงินที่มีการควบคุมถือว่าเป็นไปได้ในเชิงเศรษฐกิจ ซึ่งก็คือประชากรในปัจจุบันที่ถามแชทบอทเกี่ยวกับเงินบำนาญและหนี้

สิ่งที่ผู้บริโภคควรนำออกไป

จนกว่าแบบจำลองจะปรับปรุงหรือหน่วยงานกำกับดูแลเข้ามาแทรกแซง คำแนะนำเชิงปฏิบัติจากการวิจัยจะตรงไปตรงมา:

  • ถือว่าคำตอบของแชทบอทเกี่ยวกับภาษี เงินบำนาญ หนี้ และการออมเป็นจุดเริ่มต้นสำหรับการวิจัย ไม่ใช่เป็นคำแนะนำ
  • ตรวจสอบตัวเลขเฉพาะใดๆ — เกณฑ์ อัตรา เบี้ยเลี้ยง — เทียบกับแหล่งข้อมูลอย่างเป็นทางการก่อนดำเนินการ
  • ควรระมัดระวังเป็นพิเศษกับโมเดลระดับฟรี ซึ่งอาจเก่ากว่าหรือเล็กกว่าเวอร์ชันหลักที่แล็บโปรโมต
  • สำหรับการตัดสินใจที่เป็นผลสืบเนื่อง ที่ปรึกษาที่เป็นมนุษย์ที่ได้รับการควบคุมยังคงเป็นช่องทางเดียวที่มีความรับผิดทางกฎหมาย

คำถามที่กว้างขึ้นในรายงานคือคำถามที่อุตสาหกรรม AI จะต้องเผชิญซ้ำแล้วซ้ำเล่าในปี 2569: ความสามารถที่สร้างความประทับใจในการสาธิตและเกณฑ์มาตรฐานยังคงขาดแถบความน่าเชื่อถือที่โดเมนที่ได้รับการควบคุมต้องการ คำแนะนำทางการเงินเป็นเพียงเวทีแรกที่ช่องว่างดังกล่าวได้รับการวัดปริมาณอย่างชัดเจน

ก้าวนำหน้า AI

ติดตามว่า AI ปรับเปลี่ยนรูปแบบการเงิน การวิจัย และกฎระเบียบอย่างไร อ่านข่าว AI เพิ่มเติมบน AI Buzz Wire — การรายงานข่าวของ AI อิสระทุกวัน

---

ก้าวนำหน้า AI

รับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว

อ่านข่าว AI เพิ่มเติม →