Markov Chain คืออะไร และทำไมทฤษฎีคณิตศาสตร์เก่าแก่ถึงกลายเป็นรากฐานของ AI?
Markov Chain คือแบบจำลองทางคณิตศาสตร์ที่ใช้คำนวณความน่าจะเป็นของสถานะถัดไป โดยอาศัยข้อมูลจากสถานะปัจจุบัน แนวคิดนี้ถูกพัฒนาขึ้นโดย Andrey Markov ในปี 1905 และต่อมากลายเป็นรากฐานสำคัญของการจำลองระบบซับซ้อน ตั้งแต่โครงการระเบิดนิวเคลียร์ Google Search ไปจนถึงโมเดล AI และ Large Language Model (LLM)
หัวใจสำคัญของ Markov Chain คือแนวคิด:
“เราไม่จำเป็นต้องรู้ประวัติศาสตร์ทั้งหมดของระบบ แค่รู้สถานะปัจจุบัน ก็สามารถคาดการณ์ความเป็นไปได้ของอนาคตได้”
จากแนวคิดทางคณิตศาสตร์เล็ก ๆ ที่เกิดจากความขัดแย้งทางศาสนาและการเมืองในรัสเซีย
กลายเป็นเทคโนโลยีเบื้องหลัง:
- การจำลองนิวเคลียร์
- Search Engine
- Machine Learning
- Generative AI
จุดกำเนิด Markov Chain จากสงครามความคิดในรัสเซีย
ปี 1905 กับความขัดแย้งทางการเมือง
ต้นกำเนิดของ Markov Chain เกิดขึ้นในช่วง:
ค.ศ. 1905
ประเทศรัสเซีย
ช่วงเวลานั้นเกิดเหตุการณ์สำคัญ:
Bloody Sunday
หรือ:
“วันอาทิตย์สีเลือด”
เป็นช่วงที่:
- ประชาชนต่อต้านระบอบซาร์
- สังคมแบ่งขั้วทางการเมือง
- ความขัดแย้งลามเข้าสู่แวดวงวิชาการ
การต่อสู้ระหว่างสองแนวคิดทางคณิตศาสตร์
Pavel Nekrasov กับแนวคิด Free Will
Pavel Nekrasov
เป็นนักคณิตศาสตร์ที่สนับสนุน:
- พระเจ้าซาร์
- ศาสนา
- แนวคิดเจตจำนงเสรี
เขาพยายามใช้คณิตศาสตร์อธิบายว่า:
มนุษย์แต่ละคนมีการตัดสินใจที่เป็นอิสระ
โดยอ้างอิงจาก:
Law of Large Numbers
แนวคิดคือ:
เมื่อมีจำนวนเหตุการณ์มากพอ
พฤติกรรมรวมของสังคมสามารถคาดการณ์ได้
แต่แต่ละบุคคลยังคงมีอิสระในการตัดสินใจ
Andrey Markov กับการท้าทายแนวคิดเดิม
Andrey Markov
เป็นนักคณิตศาสตร์ที่:
- ไม่เห็นด้วยกับการนำคณิตศาสตร์ไปรับใช้ศาสนา
- ต่อต้านตรรกะที่ไม่ถูกต้อง
เขาต้องการพิสูจน์ว่า:
แม้เหตุการณ์จะไม่ได้เป็นอิสระต่อกัน
ก็ยังสามารถมีรูปแบบทางสถิติได้
นี่คือจุดกำเนิดของ:
Markov Chain
การทดลองจากวรรณกรรม Eugene Onegin
เมื่อ Markov ใช้บทกวีพิสูจน์คณิตศาสตร์
เพื่อพิสูจน์แนวคิด
Markov นำวรรณกรรมรัสเซีย:
Eugene Onegin
ของ:
Alexander Pushkin
มาวิเคราะห์
เขาตรวจสอบ:
ตัวอักษรประมาณ 20,000 ตัวแรก
สิ่งที่ค้นพบ:
ตัวอักษรถัดไปไม่ได้เกิดขึ้นแบบสุ่มทั้งหมด
ตัวอย่าง:
โอกาสที่:
สระจะตามหลังสระ
มีเพียงประมาณ:
6%
แตกต่างจากกรณีที่ตัวอักษรเป็นอิสระต่อกัน:
ประมาณ:
18%
Markov จึงสร้างแบบจำลอง:
สถานะ → ความน่าจะเป็น → สถานะถัดไป
กลายเป็น:
Markov Chain
จากตัวอักษรในหนังสือ สู่ระเบิดนิวเคลียร์
Manhattan Project กับปัญหาที่คอมพิวเตอร์ยุคแรกแก้ไม่ได้
ประมาณ 40 ปีต่อมา:
ช่วงสงครามโลกครั้งที่ 2
สหรัฐฯ ทำโครงการลับ:
Manhattan Project
ปัญหาใหญ่:
ต้องคำนวณพฤติกรรมของ:
- นิวตรอนจำนวนมหาศาล
- ปฏิกิริยาลูกโซ่
- การระเบิดในแกนยูเรเนียม
จำนวนความเป็นไปได้มากเกินไป
ประมาณ: 1067
รูปแบบ
การคำนวณตรง ๆ แทบเป็นไปไม่ได้
Stanislaw Ulam และกำเนิด Monte Carlo Method
เมื่อเกมไพ่ Solitaire นำไปสู่การปฏิวัติวิทยาศาสตร์
Stanislaw Ulam
นักคณิตศาสตร์ใน Manhattan Project
ขณะพักฟื้นจากอาการป่วย
เขาคิดถึงเกม:
Solitaire
เขาสังเกตว่า:
แทนที่จะคำนวณทุกความเป็นไปได้
อาจใช้:
- การสุ่มทดลองหลายครั้ง
- เก็บสถิติ
- หาค่าเฉลี่ย
แนวคิดนี้เรียกว่า:
Monte Carlo Method
การรวมพลัง Markov Chain + Monte Carlo
เมื่อ Ulam นำแนวคิดไปพูดคุยกับ:
John von Neumann
Von Neumann พบว่า:
พฤติกรรมของนิวตรอนมีผลต่อเนื่องกัน
ไม่ได้เป็นเหตุการณ์อิสระ
จึงต้องใช้:
Markov Chain
ร่วมกับ:
Monte Carlo Simulation
ผลลัพธ์:
สามารถจำลองปฏิกิริยานิวเคลียร์ได้
และช่วยให้โครงการ Manhattan Project สำเร็จ
Markov Chain เปลี่ยนโลกอินเทอร์เน็ตด้วย Google
ปัญหาของ Search Engine ยุคแรก
ช่วงทศวรรษ 1990:
Yahoo เป็นผู้นำ Search Engine
แต่ระบบค้นหายุคแรกใช้:
Keyword Matching
ปัญหา:
เว็บสามารถโกงได้
เช่น:
- ใส่ Keyword ซ้ำ ๆ
- ซ่อนข้อความสีขาวบนพื้นหลังสีขาว
ผลคือ:
เว็บที่ไม่ดีอาจขึ้นอันดับสูง
Google PageRank – ใช้ Markov Chain จัดอันดับโลกออนไลน์
Larry Page และ Sergey Brin
นักศึกษาปริญญาเอกจาก Stanford
คิดค้น:
PageRank
แนวคิด:
อินเทอร์เน็ตทั้งหมดถูกมองเป็น:
Markov Chain
ประกอบด้วย:
Website = State
Link = Transition
จำลอง Bot ที่:
- ท่องเว็บ
- คลิกลิงก์
- เปลี่ยนสถานะไปเรื่อย ๆ
เว็บไซต์ที่ Bot “หยุดบ่อย”
จะได้รับคะแนนสูง
นี่ทำให้ Google เข้าใจ:
“เว็บไซต์ไหนมีความสำคัญจริง”
Google ชนะ Yahoo ได้อย่างไร?
จาก Keyword สู่ Reputation Network
Yahoo:
ดูว่า:
เว็บมีคำค้นหามากแค่ไหน
Google:
ดูว่า:
เว็บอื่นเชื่อมโยงมายังเว็บนี้มากแค่ไหน
ผลลัพธ์:
Google ให้ผลค้นหาที่แม่นยำกว่า
และกลายเป็น:
Search Engine อันดับหนึ่งของโลก
จาก Markov Chain สู่ Artificial Intelligence
Claude Shannon กับการทำนายคำถัดไป
ปี:
1940s
Claude Shannon
บิดาแห่ง:
Information Theory
นำแนวคิด Markov มาใช้กับภาษา
หลักการ:
ดูคำก่อนหน้า
แล้วคาดการณ์:
คำถัดไปน่าจะเป็นอะไร
นี่กลายเป็นพื้นฐานของ:
Language Model
LLM และ AI ยุคปัจจุบันทำงานอย่างไร?
AI ไม่ได้ “เข้าใจ” ภาษาแบบมนุษย์
Large Language Model เช่น:
- GPT
- Claude
- Gemini
ทำงานผ่าน:
การคำนวณความน่าจะเป็นของ Token ถัดไป
ตัวอย่าง:
เมื่อเห็น:
“ประเทศไทยมีเมืองหลวงคือ…”
AI คำนวณว่า Token ต่อไปมีโอกาสเป็น:
“กรุงเทพฯ”
สูงที่สุด
Markov Chain กับ Transformer แตกต่างกันอย่างไร?
จากความจำสั้น สู่บริบทมหาศาล
Markov Chain แบบดั้งเดิม:
ดูสถานะก่อนหน้าเพียงไม่กี่ขั้น
แต่ Transformer ใน AI ปัจจุบัน:
สามารถดู:
- Context จำนวนมาก
- ความสัมพันธ์ซับซ้อน
- ข้อมูลระยะไกล
อย่างไรก็ตาม:
แนวคิดพื้นฐานยังคล้ายกัน:
ใช้รูปแบบในอดีตเพื่อคาดการณ์สิ่งที่จะเกิดขึ้นต่อไป
บทเรียนสำคัญจาก Markov Chain
1. ระบบซับซ้อนไม่จำเป็นต้องเข้าใจทุกอย่าง
บางครั้ง:
การรู้สถานะปัจจุบัน
เพียงพอสำหรับการทำนายอนาคต
2. คณิตศาสตร์พื้นฐานสามารถเปลี่ยนโลกได้
Markov Chain เริ่มจาก:
การวิเคราะห์ตัวอักษรในหนังสือ
แต่ต่อมากลายเป็นพื้นฐาน:
- นิวเคลียร์
- AI
3. นวัตกรรมที่ยิ่งใหญ่เกิดจากการเชื่อมโยง
Markov Chain ไม่ได้อยู่ในโลกเดียว
แต่เชื่อม:
- คณิตศาสตร์
- ฟิสิกส์
- อินเทอร์เน็ต
- AI
FAQ
Q1: Markov Chain คืออะไร?
A: Markov Chain คือแบบจำลองทางคณิตศาสตร์ที่ใช้คำนวณความน่าจะเป็นของสถานะถัดไปโดยอาศัยข้อมูลจากสถานะปัจจุบัน
Q2: Google ใช้ Markov Chain อย่างไร?
A: Google ใช้แนวคิด Markov Chain ในอัลกอริทึม PageRank เพื่อวิเคราะห์ความสำคัญของเว็บไซต์ผ่านการจำลองการเดินทางของผู้ใช้บนอินเทอร์เน็ต
Q3: Markov Chain เกี่ยวข้องกับ AI อย่างไร?
A: Markov Chain เป็นพื้นฐานแนวคิดการทำนายลำดับข้อมูล ซึ่งต่อยอดไปสู่ Language Model และ AI ที่ทำนาย Token ถัดไป
Q4: Monte Carlo Method เกี่ยวข้องกับ Markov Chain อย่างไร?
A: Monte Carlo ใช้การสุ่มจำลองจำนวนมาก ส่วน Markov Chain ช่วยจำลองระบบที่สถานะหนึ่งส่งผลต่อสถานะถัดไป ทั้งสองถูกใช้ร่วมกันในงานซับซ้อน เช่น Manhattan Project
Q5: AI เข้าใจภาษาเหมือนมนุษย์หรือไม่?
A: AI ปัจจุบันไม่ได้เข้าใจภาษาแบบมนุษย์ แต่ใช้การคำนวณรูปแบบและความน่าจะเป็นจากข้อมูลจำนวนมหาศาลเพื่อสร้างคำตอบ