ข้ามไปยังเนื้อหา
AiMing

วิธีวัดผล

เราวัดความแม่นยำอย่างไร

คำทำนายอนาคตตรวจไม่ได้ เราจึงทดสอบด้วยอดีต — เอาดวงของคนที่เรารู้ประวัติจริงมาปิดชื่อ แล้วดูว่า AI ทายเหตุการณ์ที่เกิดขึ้นแล้วได้แม่นแค่ไหน

ผลลัพธ์

86.6%

433/500 ตอบถูก

เราเอาดวงของคนดัง 100 คนจาก 20 กว่าประเทศ ที่ประวัติชีวิตถูกบันทึกไว้ชัดเจน มาใส่ในระบบโดย ปิดชื่อทั้งหมด ตั้งเป็นรหัส TEST-001 ถึง TEST-100 เพื่อไม่ให้ AI จำข้อมูลจากอินเทอร์เน็ตได้ แล้วถาม 500 คำถามเกี่ยวกับเหตุการณ์ที่เกิดขึ้นจริง ก่อนเทียบคำตอบกับความจริง

เทียบกับ AI ทั่วไปในโดเมนปาจื้อ

  • AiMing92.14%
  • ChatGPT GPT-528.3%
  • Claude 4.520.61%
  • Gemini 2.5 Flash15.15%

วิธีวัด: 10,000 questions across 100 charts, master-verified ground truth, LLM-as-judge (2025-10)

แม่นไม่เท่ากันทุกเรื่อง

เราเผยแพร่หมวดที่ทำได้แย่ที่สุดด้วย เพราะถ้าบอกว่าแม่นทุกเรื่องเท่ากัน นั่นคือสัญญาณว่าไม่ได้วัดจริง

  • ความเข้ากัน96.7%
  • การงาน92.1%
  • ทั่วไป88.9%
  • สุขภาพ88.9%
  • จังหวะเวลา83.1%
  • ครอบครัว82.5%
  • การเงิน82.5%
  • ความรัก77.8%

สิ่งที่ปาจื้อบอกไม่ได้

  • บอกช่วงเวลาได้ แต่บอกวันที่แน่นอนไม่ได้
  • บอกชื่อคน ชื่อบริษัท หรือสถานที่เฉพาะไม่ได้
  • บอกแนวโน้มสุขภาพได้ แต่วินิจฉัยโรคไม่ได้ — เราไม่ใช่แพทย์
  • ปาจื้อบอกเงื่อนไขและความน่าจะเป็น ไม่ใช่ชะตาที่ตายตัว
  • การตัดสินใจและการกระทำของคุณเปลี่ยนผลลัพธ์ได้

ขั้นตอนการทดสอบ

  1. 01

    เลือกคนที่เรารู้ประวัติจริง

    เราเลือกคนดัง 100 คนจาก 20 กว่าประเทศ ที่ประวัติชีวิตถูกบันทึกไว้ชัดเจนและตรวจสอบได้ — ผู้นำประเทศ ศิลปิน นักกีฬา นักวิทยาศาสตร์

  2. 02

    ปิดชื่อทั้งหมด

    ทุกดวงถูกใส่เข้าระบบเป็นรหัส TEST-001 ถึง TEST-100 โดยไม่มีชื่อ เพื่อไม่ให้ AI ดึงประวัติจากที่เคยอ่านบนอินเทอร์เน็ตมาตอบ นี่คือจุดที่การทดสอบส่วนใหญ่หลวม

  3. 03

    ถามเรื่องที่เกิดขึ้นแล้ว

    เราถาม 500 คำถามเกี่ยวกับเหตุการณ์จริงในชีวิตของแต่ละคน ครอบคลุม 8 หมวด — เพราะคำทำนายอนาคตตรวจไม่ได้ แต่อดีตตรวจได้

  4. 04

    เทียบกับความจริง

    ให้ผู้ตรวจอิสระเทียบคำตอบกับประวัติที่บันทึกไว้ โดยไม่หักคะแนนถ้า AI ตอบถูกความหมายแต่ใช้คำต่างกัน เช่น "ไม้" กับ "Wood" กับ "木"

เราตรวจสอบการรั่วของข้อมูลด้วย

การปิดชื่อไม่ได้กันได้ 100% — บางครั้ง AI เดาออกว่าเป็นใครจากรูปแบบของดวง เราจึงตรวจทุกข้อและพบว่ามี 8.6% ที่ AI ระบุตัวบุคคลได้ ข้อเหล่านั้นทำคะแนนดีกว่าค่าเฉลี่ยจริง แต่ส่งผลต่อคะแนนรวมเพียง 0.9 คะแนนเท่านั้น เราเปิดเผยตัวเลขนี้เพราะถ้าไม่บอก คุณก็ควรจะสงสัย

ทำไมตัวเลขนี้ต่างจากที่เห็นที่อื่น

เรามีผลทดสอบสองชุดที่วัดคนละอย่าง ชุดแรก 92.14% วัดความรู้ปาจื้อเชิงทฤษฎีจาก 10,000 questions across 100 charts, master-verified ground truth, LLM-as-judge ชุดที่สอง 86.6% วัดการอ่านชีวิตจริง ซึ่งยากกว่ามาก เราแสดงทั้งสองตัวพร้อมบอกว่าแต่ละตัววัดอะไร

คะแนนกลางของการทดสอบ 500 คำถามอยู่ที่ 95/100 ขณะที่ค่าเฉลี่ยอยู่ที่ 84.7/100 ช่องว่างนี้บอกอะไรบางอย่าง — เวลาระบบตอบถูก มันถูกเกือบเต็ม เวลาผิด มันผิดชัดเจน ไม่ค่อยมีคำตอบครึ่ง ๆ กลาง ๆ

และตัวเลขทั้งหมดนี้มีที่มาจากคนคนหนึ่ง — อ.รวิ อัญญากาญจน์ ผู้ทำวิชานี้มา 18 ปี เป็นคนกำหนดว่าคำตอบไหนถูก เมื่อระบบตอบผิด เราส่งกลับให้อาจารย์อธิบายว่าผิดกฎข้อไหน แล้วเอากฎนั้นใส่กลับเข้าระบบ