Data Licensing - AI คุณอาจไม่ได้แย่ แต่คุณแค่ขาดสิ่งนี้
AI
Data Licensing - AI คุณอาจไม่ได้แย่ แต่คุณแค่ขาดสิ่งนี้
ก่อนเปลี่ยน Model เพิ่ม Compute หรือจ้างทีมเพิ่ม ลองกลับมาดูสิ่งที่ AI ใช้เรียนรู้ก่อน เพราะต่อให้เทคโนโลยีดีแค่ไหน หาก Dataset ไม่ดีพอ ผลลัพธ์ก็อาจไม่ดีตามไปด้วย
เวลา AI ทำงานได้ไม่ตรง ไม่แม่น หรือไม่เข้าใจบริบท หลายคนอาจเริ่มตั้งคำถามกับ Model เป็นอันดับแรกแต่บางครั้ง ปัญหาไม่ได้อยู่ที่ว่า AI “ฉลาดพอหรือยัง” แต่อยู่ที่ว่า AI กำลังเรียนรู้จากข้อมูลแบบไหน
ต่อให้บริษัทมี AI Model ที่ทันสมัย มี Compute จำนวนมหาศาล หรือมีทีม Data Scientist ที่มีความเชี่ยวชาญมากแค่ไหน หาก Dataset ที่นำมา Training มีข้อมูลไม่ครบ ไม่หลากหลาย ไม่สม่ำเสมอ หรือไม่สามารถตรวจสอบที่มาและสิทธิ์ในการใช้งานได้ ปัญหาเหล่านี้ก็สามารถกลายเป็นข้อจำกัดของ AI ได้ตั้งแต่ยังไม่เริ่มใช้งานจริง
นี่จึงเป็นเหตุผลที่ Data Licensing กำลังกลายเป็นประเด็นสำคัญสำหรับองค์กรที่ต้องการนำ AI มาใช้ในระดับธุรกิจ โดยเฉพาะเมื่อข้อมูลไม่ได้มีคุณค่าเพียงในฐานะทรัพยากร แต่ยังเกี่ยวข้องกับสิทธิ์ในการนำไปใช้และการสร้างมูลค่าทางธุรกิจด้วย
เมื่อ AI เข้าสู่ระดับองค์กร คำถามไม่ได้จบที่ “ใช้ Model อะไร?”
การใช้งาน AI ในองค์กรกำลังขยายตัวอย่างรวดเร็ว โดยงานวิจัยของ McKinsey ในปี 2025 พบว่า 71% ของผู้ตอบแบบสำรวจระบุว่าองค์กรของตนมีการใช้ Generative AI เป็นประจำในอย่างน้อยหนึ่งฟังก์ชันธุรกิจ เพิ่มขึ้นจาก 65% ในช่วงต้นปี 2024
โดยแผนก Marketing & Sales เป็นหนึ่งในฟังก์ชันที่มีการนำ Generative AI ไปใช้มากที่สุด ขณะเดียวกัน 47% ขององค์กรที่ใช้ Generative AI ระบุว่าเคยพบผลกระทบด้านลบจากการใช้งาน AI อย่างน้อยหนึ่งประการ โดยความเสี่ยงด้าน Intellectual Property หรือทรัพย์สินทางปัญญาเป็นหนึ่งในประเด็นที่องค์กรกำลังให้ความสำคัญมากขึ้น
ตัวเลขเหล่านี้สะท้อนการเปลี่ยนแปลงที่น่าสนใจ เพราะ AI กำลังเดินทางจากช่วง Experiment ไปสู่การเป็นส่วนหนึ่งของกระบวนการทำงานจริง เมื่อ AI ถูกนำไปใช้กับผลิตภัณฑ์ การตลาด Customer Experience หรือระบบภายในองค์กร
Dataset ที่ดีต้องดีทั้ง Technical และ Legal
ลองนึกภาพว่าบริษัทกำลังพัฒนา AI สำหรับวิเคราะห์ภาพสินค้า และมี Dataset อยู่ 10 ล้านภาพ ตัวเลขนี้อาจดูน่าประทับใจ แต่ถ้าภาพจำนวนมากมี Resolution ต่ำ มี Label ผิด มีข้อมูลซ้ำ หรือส่วนใหญ่เป็นข้อมูลจากบริบทเดียวกัน Dataset ขนาดใหญ่ก็อาจไม่ได้ช่วยให้ AI มีประสิทธิภาพมากขึ้นเท่าที่คาดหวัง
ยิ่งไปกว่านั้น หากบริษัทไม่สามารถระบุได้ว่าภาพเหล่านั้นมาจากไหน หรือมีสิทธิ์นำไปใช้ Training AI หรือไม่ ปัญหาก็ไม่ได้อยู่เพียงในฝั่ง Technical อีกต่อไป แต่จะกลายเป็นเรื่องของ Legal, Compliance, Procurement และ Business Risk ด้วย
ดังนั้น Dataset สำหรับ AI Training จึงควรถูกประเมินอย่างน้อย 7 มิติ ได้แก่ Data Quality, Diversity, Consistency, Relevance, Scale, Data Provenance และ Licensing & Rights
Data Quality คือคุณภาพของข้อมูล ทั้งความละเอียด ความถูกต้อง และความสมบูรณ์ สำหรับ Visual AI ไม่ว่าจะเป็น Image Generation, Computer Vision หรือ Object Recognition คุณภาพของภาพมีผลโดยตรงต่อสิ่งที่ Model เรียนรู้ ขณะเดียวกัน Metadata และ Label ก็มีความสำคัญเช่นกัน เพราะหากข้อมูลถูก Label ผิดหรือขาดรายละเอียดสำคัญ AI ก็อาจเรียนรู้ความสัมพันธ์ที่ผิดตั้งแต่ต้น
Diversity คือความหลากหลายของข้อมูล AI ต้องเรียนรู้จากข้อมูลที่มีความหลากหลายเพียงพอ เพื่อให้สามารถ Generalize ไปสู่สถานการณ์จริงได้ดีขึ้น หาก Dataset มีแต่ภาพจากสภาพแวดล้อมเดียว แสงแบบเดียว หรือกลุ่มคนประเภทเดียว Model อาจทำงานได้ดีใน Dataset ของตัวเอง แต่มีข้อจำกัดเมื่อเจอสถานการณ์ที่แตกต่างออกไป เรื่องนี้ยิ่งสำคัญสำหรับองค์กรระดับ Global ที่ต้องทำงานกับ Customer และ Context ที่หลากหลาย
Consistency คือความสม่ำเสมอของข้อมูล ทั้ง Format, Structure และ Label เพราะ Dataset ที่มีขนาดใหญ่แต่ไม่มีมาตรฐานเดียวกันอาจสร้าง Noise ให้กับ Model มากกว่าช่วยให้ Model เรียนรู้ หากข้อมูลประเภทเดียวกันถูกจัด Label ด้วยคำหลายรูปแบบ หรือ Metadata ถูกจัดเก็บคนละมาตรฐาน Machine Learning ก็อาจประมวลผลความสัมพันธ์ของข้อมูลได้ยากขึ้น
Relevance คือความเกี่ยวข้องกับเป้าหมายของ AI และนี่เป็นเหตุผลว่าทำไม “ข้อมูลเยอะ” จึงไม่ได้หมายความว่า “ข้อมูลดี” เสมอไป Dataset 100 ล้านรายการที่ไม่เกี่ยวข้องกับ Use Case อาจมีประโยชน์น้อยกว่า Dataset 10 ล้านรายการที่ผ่านการ Curate มาอย่างเหมาะสม สำหรับองค์กร คำถามสำคัญจึงควรเริ่มจากว่า “เราต้องการให้ AI เรียนรู้อะไร?” แล้วจึงย้อนกลับมาดูว่า Dataset ที่เลือกสามารถตอบโจทย์นั้นได้หรือไม่
Scale คือปริมาณข้อมูลที่เหมาะสมกับ Model และ Use Case แต่ Scale ที่ดีไม่ได้หมายถึงการมีข้อมูลจำนวนมากที่สุดเสมอไป เพราะปริมาณต้องมาพร้อมกับ Quality, Diversity และ Relevance เป้าหมายจึงไม่ใช่การสะสมข้อมูลให้มากที่สุด แต่คือการสร้าง Dataset ที่มีขนาดเพียงพอและยังคงรักษาคุณภาพของข้อมูลไว้ได้
แต่ 5 ข้อนี้ยังไม่พอ
เมื่อ AI ถูกนำมาใช้ในระดับองค์กร ยังมีอีกสองคำถามที่สำคัญไม่แพ้เรื่อง Technical นั่นคือข้อมูลนี้มาจากไหน? และเรามีสิทธิ์นำข้อมูลนี้ไปใช้ Training AI หรือไม่? อย่างแรกคือ
- Data Provenance หรือความสามารถในการตรวจสอบที่มาของข้อมูล ตั้งแต่ Source, Dataset, Contributor และ Metadata ไปจนถึงเงื่อนไขการนำข้อมูลไปใช้ เรื่องนี้มีความสำคัญมากขึ้นเมื่อ Model ถูกนำไปใช้กับผลิตภัณฑ์หรือบริการจริง เพราะองค์กรจำเป็นต้องสามารถตรวจสอบย้อนกลับได้ว่า Data Pipeline ที่อยู่เบื้องหลัง Model มีที่มาอย่างไร
งานวิจัยที่เผยแพร่ใน Nature Machine Intelligence ซึ่งศึกษาประเด็น Dataset Licensing และ Attribution พบว่า Dataset ที่ถูกสำรวจมีอัตราการไม่ระบุ License มากกว่า 70% และพบความผิดพลาดในการระบุ License มากกว่า 50% ตัวเลขนี้สะท้อนปัญหาสำคัญของโลก AI ในปัจจุบันว่า การ “หา Dataset” อาจง่ายกว่าการตอบว่า Dataset นั้น “ใช้ได้อย่างถูกต้องหรือไม่”
- Licensing & Rights ซึ่งอาจเป็นหนึ่งในคำถามสำคัญที่สุดของ Enterprise AI เพราะการที่ข้อมูลสามารถค้นหา ดาวน์โหลด หรือเข้าถึงได้ ไม่ได้หมายความว่าองค์กรจะสามารถนำข้อมูลนั้นไปใช้ได้ทุกวัตถุประสงค์ License ของ Dataset แต่ละประเภทอาจมีข้อกำหนดที่แตกต่างกัน ทั้งเรื่องการใช้งานเชิงพาณิชย์ การดัดแปลง การเผยแพร่ การนำข้อมูลไป Training Model และการนำ Output ไปใช้ต่อ
พูดง่าย ๆ คือ Data Access ไม่เท่ากับ Data Rights และความแตกต่างระหว่างสองเรื่องนี้คือสิ่งที่องค์กรไม่ควรมองข้ามเมื่อกำลังสร้าง AI ของตัวเอง
Shutterstock กับ Data Licensing สำหรับ AI
นี่คือเหตุผลที่ Shutterstock เข้ามามีบทบาทในตลาด Data Licensing โดย Shutterstock ระบุว่ามี Rights-cleared Multimodal Assets มากกว่า 600 ล้านรายการ ครอบคลุม Images, Video, Audio, 3D และ Templates พร้อม Metadata ที่ผ่านการตรวจสอบโดยมนุษย์
จุดสำคัญจึงไม่ได้อยู่ที่จำนวน Asset เพียงอย่างเดียว แต่คือการนำ Content, Metadata, Curation และ Licensing มาทำงานร่วมกัน เพื่อสร้าง Dataset ที่สามารถนำไปใช้กับ AI Training และ Machine Learning Use Case ได้อย่างเหมาะสม
Shutterstock มี Dataset สำหรับ Use Case ที่หลากหลาย ตั้งแต่ Image Generation, Object Recognition และ Facial Recognition ไปจนถึง Foundation Models, Multimodal Models, Video และ Audio AI ทำให้องค์กรสามารถเลือก Data ให้สอดคล้องกับเป้าหมายของ Model แทนที่จะเริ่มต้นจากการรวบรวมข้อมูลแบบกระจัดกระจายจากหลายแหล่ง
Data Licensing จึงกำลังเปลี่ยนจากเรื่องที่ดูเหมือนเป็นรายละเอียดทางกฎหมาย ไปเป็นส่วนหนึ่งของ AI Strategy, Data Strategy และ Enterprise Infrastructure เพราะยิ่งองค์กรต้องการสร้าง AI ที่มีความสามารถเฉพาะทางมากขึ้น ความสำคัญของ Data ที่มีคุณภาพและมีสิทธิ์ใช้งานอย่างชัดเจนก็ยิ่งเพิ่มขึ้นตามไปด้วย
สำหรับองค์กรที่กำลังพัฒนา AI Model, Fine-tune Model, Computer Vision, Generative AI หรือ Multimodal AI การเริ่มต้นด้วย Dataset ที่มีคุณภาพและมี Licensing ที่เหมาะสม อาจช่วยลดทั้งเวลา ต้นทุน และความเสี่ยงในระยะยาว
เพราะก่อนจะถามว่า Model ไหนเก่งที่สุด? องค์กรต้องถามตัวเองให้ชัดก่อนว่า เรากำลังให้ AI เรียนรู้จาก Data ที่ดีที่สุดสำหรับงานนี้แล้วหรือยัง?
หากองค์กรของคุณกำลังมองหา Licensed Data สำหรับ AI Training หรือ Dataset คุณภาพสูงสำหรับ Use Case เฉพาะทาง Number 24 x Shutterstock พร้อมช่วยเชื่อมต่อองค์กรกับโซลูชันด้าน Data Licensing และ AI Training Dataset ที่เหมาะกับความต้องการของธุรกิจ ไม่ว่าจะเป็น Image, Video, Audio, 3D หรือ Multimodal Data
เพราะการสร้าง AI ที่พร้อมสำหรับธุรกิจ ไม่ได้เริ่มต้นจากการเลือก Model ที่ดีที่สุดเพียงอย่างเดียว แต่อาจเริ่มต้นจากการเลือก Data ที่ใช่ ตั้งแต่วันแรก
ติดต่อการใช้งาน Number 24 ได้ที่
Inbox : http://m.me/number24.co.th
LINE Official Account : https://line.me/R/ti/p/@klj9484n
Instagram : https://www.instagram.com/number24.co.th
Website : https://number24.co.th/
