Claude Fable 5.1 ทำงานจบแทนคุณได้แค่ไหน? เปิด 6 ด้านที่เก่งขึ้นจริง

TL;DR
TL;DRTL;DR- Claude Fable 5.1 ทำ workflow ธุรกิจหลายขั้นตอนผ่านเพิ่มจาก 17.1% เป็น 31.4% เกือบเท่าตัว
- งานหน้าจอแบบเข้มข้นทำได้ดีขึ้นจาก 36.1% เป็น 41.7% แต่ยังแนะนำให้คนกดยืนยันก่อนส่งออก
- งานยาวต่อเนื่องหลายสิบสเต็ปหลุดกลางทางน้อยลง คะแนนขยับจาก 42.0% เป็น 55.8%
- คุณภาพงานความรู้อย่างรายงานลูกค้าและใบเสนอราคาดีขึ้น คะแนนจาก 1723 เป็น 1853
- ต้นทุนต่องานลดลงสูงสุด 45% สำหรับงานที่รันต่อเนื่อง และ cache read ถูกลง 75%

สมมติเช้าวันจันทร์
คุณเปิดโฟลเดอร์ที่มีไฟล์ยอดขายรอสรุปอยู่
ไฟล์ครบ แต่ยังไม่มีใครรวม
รวมเสร็จยังต้องทำรายงานส่งลูกค้าต่ออีกชุด
งานนี้ไม่ยาก แต่กินทั้งเช้า
ผมไล่อ่านหน้าสเปกที่ Anthropic เปิดตัว
Claude Fable 5.1 แล้วสะดุดตรงหนึ่ง
เค้าไม่ได้วัดว่า "ตอบเก่งขึ้นแค่ไหน"
เค้าวัดว่า "ทำงานจบเองได้แค่ไหน"
.
6 ด้านที่ Fable 5.1 เก่งขึ้น
.
𝟏. งานธุรกิจที่มีหลายขั้นตอน
AutomationBench คือชุดทดสอบ workflow ธุรกิจ
Fable 5 ทำผ่าน 17.1%
Fable 5.1 ทำผ่าน 31.4%
เกือบเท่าตัวในรุ่นเดียว และนี่คือช่องที่ขยับ
แรงที่สุดในรอบนี้
แปลเป็นภาษางานคุณ คือกลุ่มงานที่เป็นลำดับ
รับไฟล์ ไปรวม ไปสรุป ไปออกรายงาน
เริ่มจากงานที่คุณทำซ้ำทุกเดือนก่อน
ไม่ใช่งานที่ทำปีละครั้ง เพราะงานซ้ำคือที่ที่
เวลาของทีมหายไปเงียบ ๆ
.
𝟐. งานหน้าจอ ไม่ใช่แค่งานพิมพ์
OSWorld วัดการคุมคอมพิวเตอร์จริง
เปิดโปรแกรม คลิก กรอกฟอร์ม
เกณฑ์ผ่านบางส่วน ขยับจาก 72.9% เป็น 77.9%
เกณฑ์เข้มที่ต้องถูกทุกจุด 36.1% เป็น 41.7%
ตัวเลขชุดหลังคือชุดที่ผมอยากให้คุณดูให้ดี
ยังไม่ถึงครึ่ง
ผมการันตีให้ไม่ได้ว่างานหน้าจอที่พลาดไม่ได้
จะปล่อยมือได้แล้ว แต่การันตีได้ว่างานคีย์ซ้ำ
เอาไปให้มันทำ แล้วคุณเป็นคนกดยืนยัน คุ้มกว่า
นั่งคีย์เองทั้งชุด
.
𝟑. งานยาวที่ต้องเดินต่อเนื่องหลายสิบสเต็ป
Terminal-Bench 4.0 วัดงานที่ต้องทำต่อกันยาว
Fable 5 อยู่ที่ 42.0%
Fable 5.1 อยู่ที่ 55.8%
ความหมายคือมันหลุดกลางทางน้อยลง
งานที่เคยต้องมาไล่จับว่า "ทำถึงไหนแล้ว"
เหลือมาเช็คตอนจบทีเดียว
รุ่นพี่ของมันคือ Mythos 5.1 ทำได้ 60.9%
แต่เปิดให้เฉพาะบางองค์กรในสหรัฐ
เลยยังไม่ใช่ตัวเลือกของคุณตอนนี้
.
𝟒. คุณภาพของงานความรู้
GDPval-AA v2 วัดงานระดับมืออาชีพ
คะแนนขยับจาก 1723 เป็น 1853
งานเขียน งานวิเคราะห์ งานสรุปเอกสาร
อยู่ในกลุ่มนี้ทั้งหมด
จุดที่ใช้ได้เลยคือเอกสารที่คุณต้องส่งออกไป
ข้างนอก ใบเสนอราคา รายงานลูกค้า สรุปประชุม
ของแบบนี้เสียหายทีเดียวคือเสียลูกค้า
คะแนนที่ขยับตรงนี้จึงมีค่ากว่าคะแนนสอบทั่วไป
.
𝟓. คิดเรื่องยากที่ไม่มีในคู่มือ
Humanity's Last Exam เป็นข้อสอบข้ามศาสตร์
แบบไม่ใช้เครื่องมือ 57.8% เป็น 60.9%
แบบใช้เครื่องมือ 63.8% เป็น 65.0%
สังเกตช่องว่างระหว่างสองเลขนี้
มันแคบลง แปลว่าตัวโมเดลเองคิดได้มากขึ้น
ก่อนจะไปพึ่งเครื่องมือภายนอก
กับงานคุณคือคำถามที่ไม่มีสูตรตายตัว
ควรขึ้นราคาไหม ควรตัดสินค้าตัวไหนทิ้ง
คุณได้คู่คิดที่ตอบได้ลึกขึ้นโดยไม่ต้องต่อของ
เพิ่มให้ยุ่ง
.
𝟔. ต้นทุนต่อชิ้นงาน
ราคาป้ายเท่าเดิม
$10 ต่อล้าน input token
$50 ต่อล้าน output token
แต่ต้นทุนจริงต่องานลดลง
งานทั่วไปถูกลงราว 25%
งานที่ยิงยาวต่อเนื่อง ถูกลงสูงสุดราว 45%
ส่วน cache read ลดลง 75% เหลือ $0.25
ต่อล้าน token
ข้อนี้ตรงกับคนที่วางระบบอัตโนมัติมากที่สุด
เพราะระบบที่รันทุกวันคือระบบที่จ่ายทุกวัน
ส่วนลดจึงไปโผล่ที่บิลสิ้นเดือน ไม่ใช่ที่ความรู้สึก
.
รวม 6 ด้านแล้วได้ภาพเดียวกัน
รุ่นนี้ไม่ได้ถูกออกแบบมาให้คุยเก่งขึ้น
แต่ถูกออกแบบมาให้ทำงานจบแทนคุณได้มากขึ้น
ในราคาที่ถูกลง
คำถามที่อยากให้คุณลองตอบกับตัวเอง
งานไหนในสัปดาห์นี้ ที่คุณทำอยู่แค่เพราะ
"ยังไม่มีใครทำแทนได้" ไม่ใช่เพราะมันต้องใช้
คุณจริง ๆ
ถ้าคุณอยากวางระบบให้ AI รับงานซ้ำไปทั้งเส้น
แบบเป็นขั้นเป็นตอน ผมสอนไว้ในคอร์สฟรี
ทักมารับได้เลย
LINE OA: @drgim
โทร 065-649-5145
#หมอกิม #AIMAcademy #ClaudeFable51 #AIทำงานให้ธุรกิจ #AIforSME
Reference : https://www.anthropic.com/claude-fable-and-mythos-5-1
#หมอกิม #AIMAcademy #AIสำหรับธุรกิจ #ออโตเมชั่นสำหรับSME #AIforSME
How-to
HOW-TOHOW-TOQ&A
Q&AQ&ARelated Assets
ASSETSASSETSปั้น AI ให้เก่งในพริบตา
คลัง AI Asset พร้อมใช้กว่า 300 ตัว — ก็อปวางใน ChatGPT / Claude / Gemini แล้วใช้ได้เลย ไม่ต้องเขียนเอง
อยากเข้าใจลึกกว่านี้?
ebook อ่านจบ 2 ชม. ได้ระบบ AI ใช้จริง — ฿199