Markov Chain คืออะไร และทำไมทฤษฎีคณิตศาสตร์เก่าแก่ถึงกลายเป็นรากฐานของ AI?

Markov Chain คือแบบจำลองทางคณิตศาสตร์ที่ใช้คำนวณความน่าจะเป็นของสถานะถัดไป โดยอาศัยข้อมูลจากสถานะปัจจุบัน แนวคิดนี้ถูกพัฒนาขึ้นโดย Andrey Markov ในปี 1905 และต่อมากลายเป็นรากฐานสำคัญของการจำลองระบบซับซ้อน ตั้งแต่โครงการระเบิดนิวเคลียร์ Google Search ไปจนถึงโมเดล AI และ Large Language Model (LLM)

หัวใจสำคัญของ Markov Chain คือแนวคิด:

“เราไม่จำเป็นต้องรู้ประวัติศาสตร์ทั้งหมดของระบบ แค่รู้สถานะปัจจุบัน ก็สามารถคาดการณ์ความเป็นไปได้ของอนาคตได้”

จากแนวคิดทางคณิตศาสตร์เล็ก ๆ ที่เกิดจากความขัดแย้งทางศาสนาและการเมืองในรัสเซีย

กลายเป็นเทคโนโลยีเบื้องหลัง:

จุดกำเนิด Markov Chain จากสงครามความคิดในรัสเซีย

ปี 1905 กับความขัดแย้งทางการเมือง

ต้นกำเนิดของ Markov Chain เกิดขึ้นในช่วง:

ค.ศ. 1905

ประเทศรัสเซีย

ช่วงเวลานั้นเกิดเหตุการณ์สำคัญ:

Bloody Sunday

หรือ:

“วันอาทิตย์สีเลือด”

เป็นช่วงที่:

การต่อสู้ระหว่างสองแนวคิดทางคณิตศาสตร์

Pavel Nekrasov กับแนวคิด Free Will

Pavel Nekrasov

เป็นนักคณิตศาสตร์ที่สนับสนุน:

เขาพยายามใช้คณิตศาสตร์อธิบายว่า:

มนุษย์แต่ละคนมีการตัดสินใจที่เป็นอิสระ

โดยอ้างอิงจาก:

Law of Large Numbers

แนวคิดคือ:

เมื่อมีจำนวนเหตุการณ์มากพอ

พฤติกรรมรวมของสังคมสามารถคาดการณ์ได้

แต่แต่ละบุคคลยังคงมีอิสระในการตัดสินใจ

Andrey Markov กับการท้าทายแนวคิดเดิม

Andrey Markov

เป็นนักคณิตศาสตร์ที่:

เขาต้องการพิสูจน์ว่า:

แม้เหตุการณ์จะไม่ได้เป็นอิสระต่อกัน

ก็ยังสามารถมีรูปแบบทางสถิติได้

นี่คือจุดกำเนิดของ:

Markov Chain

การทดลองจากวรรณกรรม Eugene Onegin

เมื่อ Markov ใช้บทกวีพิสูจน์คณิตศาสตร์

เพื่อพิสูจน์แนวคิด

Markov นำวรรณกรรมรัสเซีย:

Eugene Onegin

ของ:

Alexander Pushkin

มาวิเคราะห์

เขาตรวจสอบ:

ตัวอักษรประมาณ 20,000 ตัวแรก

สิ่งที่ค้นพบ:

ตัวอักษรถัดไปไม่ได้เกิดขึ้นแบบสุ่มทั้งหมด

ตัวอย่าง:

โอกาสที่:

สระจะตามหลังสระ

มีเพียงประมาณ:

6%

แตกต่างจากกรณีที่ตัวอักษรเป็นอิสระต่อกัน:

ประมาณ:

18%

Markov จึงสร้างแบบจำลอง:

สถานะ → ความน่าจะเป็น → สถานะถัดไป

กลายเป็น:

Markov Chain

จากตัวอักษรในหนังสือ สู่ระเบิดนิวเคลียร์

Manhattan Project กับปัญหาที่คอมพิวเตอร์ยุคแรกแก้ไม่ได้

ประมาณ 40 ปีต่อมา:

ช่วงสงครามโลกครั้งที่ 2

สหรัฐฯ ทำโครงการลับ:

Manhattan Project

ปัญหาใหญ่:

ต้องคำนวณพฤติกรรมของ:

จำนวนความเป็นไปได้มากเกินไป

ประมาณ: 1067

รูปแบบ

การคำนวณตรง ๆ แทบเป็นไปไม่ได้

Stanislaw Ulam และกำเนิด Monte Carlo Method

เมื่อเกมไพ่ Solitaire นำไปสู่การปฏิวัติวิทยาศาสตร์

Stanislaw Ulam

นักคณิตศาสตร์ใน Manhattan Project

ขณะพักฟื้นจากอาการป่วย

เขาคิดถึงเกม:

Solitaire

เขาสังเกตว่า:

แทนที่จะคำนวณทุกความเป็นไปได้

อาจใช้:

แนวคิดนี้เรียกว่า:

Monte Carlo Method

การรวมพลัง Markov Chain + Monte Carlo

เมื่อ Ulam นำแนวคิดไปพูดคุยกับ:

John von Neumann

Von Neumann พบว่า:

พฤติกรรมของนิวตรอนมีผลต่อเนื่องกัน

ไม่ได้เป็นเหตุการณ์อิสระ

จึงต้องใช้:

Markov Chain

ร่วมกับ:

Monte Carlo Simulation

ผลลัพธ์:

สามารถจำลองปฏิกิริยานิวเคลียร์ได้

และช่วยให้โครงการ Manhattan Project สำเร็จ

Markov Chain เปลี่ยนโลกอินเทอร์เน็ตด้วย Google

ปัญหาของ Search Engine ยุคแรก

ช่วงทศวรรษ 1990:

Yahoo เป็นผู้นำ Search Engine

แต่ระบบค้นหายุคแรกใช้:

Keyword Matching

ปัญหา:

เว็บสามารถโกงได้

เช่น:

ผลคือ:

เว็บที่ไม่ดีอาจขึ้นอันดับสูง

Google PageRank – ใช้ Markov Chain จัดอันดับโลกออนไลน์

Larry Page และ Sergey Brin

นักศึกษาปริญญาเอกจาก Stanford

คิดค้น:

PageRank

แนวคิด:

อินเทอร์เน็ตทั้งหมดถูกมองเป็น:

Markov Chain

ประกอบด้วย:

Website = State

Link = Transition

จำลอง Bot ที่:

เว็บไซต์ที่ Bot “หยุดบ่อย”

จะได้รับคะแนนสูง

นี่ทำให้ Google เข้าใจ:

“เว็บไซต์ไหนมีความสำคัญจริง”

Google ชนะ Yahoo ได้อย่างไร?

จาก Keyword สู่ Reputation Network

Yahoo:

ดูว่า:

เว็บมีคำค้นหามากแค่ไหน

Google:

ดูว่า:

เว็บอื่นเชื่อมโยงมายังเว็บนี้มากแค่ไหน

ผลลัพธ์:

Google ให้ผลค้นหาที่แม่นยำกว่า

และกลายเป็น:

Search Engine อันดับหนึ่งของโลก

จาก Markov Chain สู่ Artificial Intelligence

Claude Shannon กับการทำนายคำถัดไป

ปี:

1940s

Claude Shannon

บิดาแห่ง:

Information Theory

นำแนวคิด Markov มาใช้กับภาษา

หลักการ:

ดูคำก่อนหน้า

แล้วคาดการณ์:

คำถัดไปน่าจะเป็นอะไร

นี่กลายเป็นพื้นฐานของ:

Language Model

LLM และ AI ยุคปัจจุบันทำงานอย่างไร?

AI ไม่ได้ “เข้าใจ” ภาษาแบบมนุษย์

Large Language Model เช่น:

ทำงานผ่าน:

การคำนวณความน่าจะเป็นของ Token ถัดไป

ตัวอย่าง:

เมื่อเห็น:

“ประเทศไทยมีเมืองหลวงคือ…”

AI คำนวณว่า Token ต่อไปมีโอกาสเป็น:

“กรุงเทพฯ”

สูงที่สุด

Markov Chain กับ Transformer แตกต่างกันอย่างไร?

จากความจำสั้น สู่บริบทมหาศาล

Markov Chain แบบดั้งเดิม:

ดูสถานะก่อนหน้าเพียงไม่กี่ขั้น

แต่ Transformer ใน AI ปัจจุบัน:

สามารถดู:

อย่างไรก็ตาม:

แนวคิดพื้นฐานยังคล้ายกัน:

ใช้รูปแบบในอดีตเพื่อคาดการณ์สิ่งที่จะเกิดขึ้นต่อไป

บทเรียนสำคัญจาก Markov Chain

1. ระบบซับซ้อนไม่จำเป็นต้องเข้าใจทุกอย่าง

บางครั้ง:

การรู้สถานะปัจจุบัน

เพียงพอสำหรับการทำนายอนาคต

2. คณิตศาสตร์พื้นฐานสามารถเปลี่ยนโลกได้

Markov Chain เริ่มจาก:

การวิเคราะห์ตัวอักษรในหนังสือ

แต่ต่อมากลายเป็นพื้นฐาน:

3. นวัตกรรมที่ยิ่งใหญ่เกิดจากการเชื่อมโยง

Markov Chain ไม่ได้อยู่ในโลกเดียว

แต่เชื่อม:

FAQ

Q1: Markov Chain คืออะไร?

A: Markov Chain คือแบบจำลองทางคณิตศาสตร์ที่ใช้คำนวณความน่าจะเป็นของสถานะถัดไปโดยอาศัยข้อมูลจากสถานะปัจจุบัน

Q2: Google ใช้ Markov Chain อย่างไร?

A: Google ใช้แนวคิด Markov Chain ในอัลกอริทึม PageRank เพื่อวิเคราะห์ความสำคัญของเว็บไซต์ผ่านการจำลองการเดินทางของผู้ใช้บนอินเทอร์เน็ต

Q3: Markov Chain เกี่ยวข้องกับ AI อย่างไร?

A: Markov Chain เป็นพื้นฐานแนวคิดการทำนายลำดับข้อมูล ซึ่งต่อยอดไปสู่ Language Model และ AI ที่ทำนาย Token ถัดไป

Q4: Monte Carlo Method เกี่ยวข้องกับ Markov Chain อย่างไร?

A: Monte Carlo ใช้การสุ่มจำลองจำนวนมาก ส่วน Markov Chain ช่วยจำลองระบบที่สถานะหนึ่งส่งผลต่อสถานะถัดไป ทั้งสองถูกใช้ร่วมกันในงานซับซ้อน เช่น Manhattan Project

Q5: AI เข้าใจภาษาเหมือนมนุษย์หรือไม่?

A: AI ปัจจุบันไม่ได้เข้าใจภาษาแบบมนุษย์ แต่ใช้การคำนวณรูปแบบและความน่าจะเป็นจากข้อมูลจำนวนมหาศาลเพื่อสร้างคำตอบ