วิธีวัดผล
เราวัดความแม่นยำอย่างไร
คำทำนายอนาคตตรวจไม่ได้ เราจึงทดสอบด้วยอดีต — เอาดวงของคนที่เรารู้ประวัติจริงมาปิดชื่อ แล้วดูว่า AI ทายเหตุการณ์ที่เกิดขึ้นแล้วได้แม่นแค่ไหน
ผลลัพธ์
86.6%
433/500 ตอบถูก
เราเอาดวงของคนดัง 100 คนจาก 20 กว่าประเทศ ที่ประวัติชีวิตถูกบันทึกไว้ชัดเจน มาใส่ในระบบโดย ปิดชื่อทั้งหมด ตั้งเป็นรหัส TEST-001 ถึง TEST-100 เพื่อไม่ให้ AI จำข้อมูลจากอินเทอร์เน็ตได้ แล้วถาม 500 คำถามเกี่ยวกับเหตุการณ์ที่เกิดขึ้นจริง ก่อนเทียบคำตอบกับความจริง
เทียบกับ AI ทั่วไปในโดเมนปาจื้อ
- AiMing92.14%
- ChatGPT GPT-528.3%
- Claude 4.520.61%
- Gemini 2.5 Flash15.15%
วิธีวัด: 10,000 questions across 100 charts, master-verified ground truth, LLM-as-judge (2025-10)
แม่นไม่เท่ากันทุกเรื่อง
เราเผยแพร่หมวดที่ทำได้แย่ที่สุดด้วย เพราะถ้าบอกว่าแม่นทุกเรื่องเท่ากัน นั่นคือสัญญาณว่าไม่ได้วัดจริง
- ความเข้ากัน96.7%
- การงาน92.1%
- ทั่วไป88.9%
- สุขภาพ88.9%
- จังหวะเวลา83.1%
- ครอบครัว82.5%
- การเงิน82.5%
- ความรัก77.8%
สิ่งที่ปาจื้อบอกไม่ได้
- บอกช่วงเวลาได้ แต่บอกวันที่แน่นอนไม่ได้
- บอกชื่อคน ชื่อบริษัท หรือสถานที่เฉพาะไม่ได้
- บอกแนวโน้มสุขภาพได้ แต่วินิจฉัยโรคไม่ได้ — เราไม่ใช่แพทย์
- ปาจื้อบอกเงื่อนไขและความน่าจะเป็น ไม่ใช่ชะตาที่ตายตัว
- การตัดสินใจและการกระทำของคุณเปลี่ยนผลลัพธ์ได้
ขั้นตอนการทดสอบ
- 01
เลือกคนที่เรารู้ประวัติจริง
เราเลือกคนดัง 100 คนจาก 20 กว่าประเทศ ที่ประวัติชีวิตถูกบันทึกไว้ชัดเจนและตรวจสอบได้ — ผู้นำประเทศ ศิลปิน นักกีฬา นักวิทยาศาสตร์
- 02
ปิดชื่อทั้งหมด
ทุกดวงถูกใส่เข้าระบบเป็นรหัส TEST-001 ถึง TEST-100 โดยไม่มีชื่อ เพื่อไม่ให้ AI ดึงประวัติจากที่เคยอ่านบนอินเทอร์เน็ตมาตอบ นี่คือจุดที่การทดสอบส่วนใหญ่หลวม
- 03
ถามเรื่องที่เกิดขึ้นแล้ว
เราถาม 500 คำถามเกี่ยวกับเหตุการณ์จริงในชีวิตของแต่ละคน ครอบคลุม 8 หมวด — เพราะคำทำนายอนาคตตรวจไม่ได้ แต่อดีตตรวจได้
- 04
เทียบกับความจริง
ให้ผู้ตรวจอิสระเทียบคำตอบกับประวัติที่บันทึกไว้ โดยไม่หักคะแนนถ้า AI ตอบถูกความหมายแต่ใช้คำต่างกัน เช่น "ไม้" กับ "Wood" กับ "木"
เราตรวจสอบการรั่วของข้อมูลด้วย
การปิดชื่อไม่ได้กันได้ 100% — บางครั้ง AI เดาออกว่าเป็นใครจากรูปแบบของดวง เราจึงตรวจทุกข้อและพบว่ามี 8.6% ที่ AI ระบุตัวบุคคลได้ ข้อเหล่านั้นทำคะแนนดีกว่าค่าเฉลี่ยจริง แต่ส่งผลต่อคะแนนรวมเพียง 0.9 คะแนนเท่านั้น เราเปิดเผยตัวเลขนี้เพราะถ้าไม่บอก คุณก็ควรจะสงสัย
ทำไมตัวเลขนี้ต่างจากที่เห็นที่อื่น
เรามีผลทดสอบสองชุดที่วัดคนละอย่าง ชุดแรก 92.14% วัดความรู้ปาจื้อเชิงทฤษฎีจาก 10,000 questions across 100 charts, master-verified ground truth, LLM-as-judge ชุดที่สอง 86.6% วัดการอ่านชีวิตจริง ซึ่งยากกว่ามาก เราแสดงทั้งสองตัวพร้อมบอกว่าแต่ละตัววัดอะไร
คะแนนกลางของการทดสอบ 500 คำถามอยู่ที่ 95/100 ขณะที่ค่าเฉลี่ยอยู่ที่ 84.7/100 ช่องว่างนี้บอกอะไรบางอย่าง — เวลาระบบตอบถูก มันถูกเกือบเต็ม เวลาผิด มันผิดชัดเจน ไม่ค่อยมีคำตอบครึ่ง ๆ กลาง ๆ
และตัวเลขทั้งหมดนี้มีที่มาจากคนคนหนึ่ง — อ.รวิ อัญญากาญจน์ ผู้ทำวิชานี้มา 18 ปี เป็นคนกำหนดว่าคำตอบไหนถูก เมื่อระบบตอบผิด เราส่งกลับให้อาจารย์อธิบายว่าผิดกฎข้อไหน แล้วเอากฎนั้นใส่กลับเข้าระบบ