ข้ามไปที่เนื้อหาหลัก

บทความ

กำลังแสดงโพสต์ที่มีป้ายกำกับ ComputerVision

Map-Free Visual Relocalization Enhanced by Instance Knowledge and Depth Knowledge

Map-Free Visual Relocalization Enhanced by Instance Knowledge and Depth Knowledge Map-Free Visual Relocalization Enhanced by Instance Knowledge and Depth Knowledge ในยุคที่เทคโนโลยีการมองเห็นด้วยคอมพิวเตอร์ (Computer Vision) ก้าวหน้าอย่างรวดเร็ว การระบุตำแหน่งและทิศทางของวัตถุในสภาพแวดล้อมที่ไม่เคยเห็นมาก่อน (Map-Free Visual Relocalization) เป็นหนึ่งในความท้าทายที่สำคัญ โดยเฉพาะในงานที่เกี่ยวข้องกับหุ่นยนต์และรถยนต์ไร้คนขับ เทคโนโลยีนี้ได้รับการพัฒนาให้มีความแม่นยำมากขึ้นด้วยการผสานความรู้เกี่ยวกับวัตถุ (Instance Knowledge) และข้อมูลความลึก (Depth Knowledge) เข้าด้วยกัน การทำงานของ Map-Free Visual Relocalization Map-Free Visual Relocalization เป็นกระบวนการที่ระบบสามารถระบุตำแหน่งของตัวเองในสภาพแวดล้อมใหม่โดยไม่ต้องพึ่งพาแผนที่ที่สร้างไว้ล่วงหน้า ระบบนี้ใช้ข้อมูลจากภาพถ่ายหรือวิดีโอที่บันทึกได้ในเวลาจริง เพื่อวิเคราะห์และระบุตำแหน่งที่แน่นอน โดยอาศัยเทคนิคการเรียนรู้เชิงลึก (Deep Learning) และการประมวลผลภาพขั้นสูง บทบาทของ Instance Know...

Discover-then-Name: สู่คอขวดเชิงแนวคิดของงานผ่านการค้นพบแนวคิดอัตโนมัติ

Discover-then-Name: สู่คอขวดเชิงแนวคิดของงานผ่านการค้นพบแนวคิดอัตโนมัติ Discover-then-Name: สู่คอขวดเชิงแนวคิดของงานผ่านการค้นพบแนวคิดอัตโนมัติ ในโลกของปัญญาประดิษฐ์ (AI) การทำให้เครื่องจักรสามารถเรียนรู้และเข้าใจโลกได้เหมือนมนุษย์นั้นเป็นเป้าหมายที่ท้าทายอย่างยิ่ง หนึ่งในความท้าทายสำคัญคือการสร้างแบบจำลองที่สามารถสรุปความรู้จากข้อมูลได้อย่างมีประสิทธิภาพ และนำความรู้นั้นไปประยุกต์ใช้กับงานใหม่ๆ ได้หลากหลาย วิธีการเรียนรู้เชิงลึก (Deep Learning) ได้แสดงให้เห็นถึงประสิทธิภาพอันโดดเด่นในการแก้ปัญหาต่างๆ เช่น การรู้จำภาพ การประมวลผลภาษาธรรมชาติ และการเล่นเกม อย่างไรก็ตาม แบบจำลอง Deep Learning ส่วนใหญ่มักถูกจำกัดอยู่กับงานเฉพาะ (Task-Specific) ซึ่งหมายความว่าแบบจำลองที่ถูกฝึกฝนมาสำหรับงานหนึ่งอาจไม่สามารถทำงานอื่นได้ดีเท่าที่ควร สาเหตุหนึ่งที่ทำให้เกิดข้อจำกัดนี้คือ "คอขวดเชิงแนวคิด" (Concept Bottleneck) ซึ่งหมายถึงข้อจำกัดของแบบจำลองในการเรียนรู้และเป็นตัวแทนของแนวคิดที่เป็นนามธรรมและใช้ประโยชน์ได้ทั่วไป Discover-then-Name: กระบวนทัศน์ใหม่ในการเรียนรู้ของ...

Robust Domain Generalization สำหรับการรู้จำวัตถุแบบหลายรูปแบบ

Robust Domain Generalization สำหรับการรู้จำวัตถุแบบหลายรูปแบบ Robust Domain Generalization สำหรับการรู้จำวัตถุแบบหลายรูปแบบ ในยุคแห่งข้อมูลที่ล้นหลาม เทคโนโลยีการเรียนรู้ของเครื่อง (Machine Learning) และปัญญาประดิษฐ์ (Artificial Intelligence) เข้ามามีบทบาทสำคัญในการดำเนินชีวิตประจำวันของมนุษย์อย่างหลีกเลี่ยงไม่ได้ หนึ่งในความก้าวหน้าที่น่าตื่นเต้นคือ การรู้จำวัตถุ (Object Recognition) ซึ่งเป็นกระบวนการที่ระบบคอมพิวเตอร์สามารถระบุและจำแนกวัตถุต่างๆ ในภาพหรือวิดีโอได้ เทคโนโลยีนี้มีศักยภาพในการปฏิวัติอุตสาหกรรมต่างๆ ตั้งแต่รถยนต์ขับเคลื่อนอัตโนมัติไปจนถึงการวินิจฉัยทางการแพทย์ อย่างไรก็ตาม ความท้าทายที่สำคัญประการหนึ่งของการรู้จำวัตถุคือ ปัญหา Domain Shift ปัญหานี้เกิดขึ้นเมื่อแบบจำลองการเรียนรู้ของเครื่องที่ได้รับการฝึกฝนบนชุดข้อมูลเฉพาะ (Source Domain) ไม่สามารถทำงานได้ดีบนชุดข้อมูลใหม่ที่แตกต่างกัน (Target Domain) ซึ่งอาจมีการเปลี่ยนแปลงของสภาพแวดล้อม มุมกล้อง หรือลักษณะของวัตถุ ตัวอย่างเช่น แบบจำลองที่ได้รับการฝึกฝนบนภาพถ่ายของรถยนต์ในเวลากลางวัน อาจทำงานได้ไม่ดีบนภาพ...

การประยุกต์ใช้ Deep Learning ในการสร้างแผนที่ระยะทางเพื่อคำนวณเส้นผ่านศูนย์กลางของเส้นใยจากภาพจุลทรรศน์ดิจิทัล

การประยุกต์ใช้ Deep Learning ในการสร้างแผนที่ระยะทางเพื่อคำนวณเส้นผ่านศูนย์กลางของเส้นใยจากภาพจุลทรรศน์ดิจิทัล การประยุกต์ใช้ Deep Learning ในการสร้างแผนที่ระยะทางเพื่อคำนวณเส้นผ่านศูนย์กลางของเส้นใยจากภาพจุลทรรศน์ดิจิทัล ในยุคแห่งเทคโนโลยีและนวัตกรรม การพัฒนาเทคโนโลยีการวิเคราะห์ภาพด้วยคอมพิวเตอร์ (Computer Vision) และการเรียนรู้เชิงลึก (Deep Learning) ได้เข้ามามีบทบาทสำคัญอย่างยิ่งในหลากหลายสาขาวิชา ไม่ว่าจะเป็นวงการแพทย์ อุตสาหกรรม หรือแม้กระทั่งงานวิจัยทางวิทยาศาสตร์ หนึ่งในงานวิจัยที่น่าสนใจและมีศักยภาพสูง คือ การนำ Deep Learning มาประยุกต์ใช้ในการสร้างแผนที่ระยะทาง (Distance Map) เพื่อคำนวณเส้นผ่านศูนย์กลางของเส้นใยจากภาพจุลทรรศน์ดิจิทัล บทความวิจัย Sensors, Vol. 24, Pages 5497: A Deep Learning Approach to Distance Map Generation Applied to Automatic Fiber Diameter Computation from Digital Micrographs ได้นำเสนอวิธีการใหม่ในการคำนวณเส้นผ่านศูนย์กลางของเส้นใยจากภาพจุลทรรศน์ดิจิทัล โดยอาศัย Deep Learning ในการสร้างแผนที่ระยะทาง ซึ่งเป็นเทคนิคที่ช่วยในการวิเคราะห์รู...

ความไม่แน่นอนของ Latent Representation ในงานวิชั่นคอมพิวเตอร์

ความไม่แน่นอนของ Latent Representation ในงานวิชั่นคอมพิวเตอร์ ## ความไม่แน่นอนของ Latent Representation ในงานวิชั่นคอมพิวเตอร์ ในโลกของวิชั่นคอมพิวเตอร์ (Computer Vision) ซึ่งเป็นสาขาหนึ่งของปัญญาประดิษฐ์ (Artificial Intelligence) ที่มุ่งเน้นการทำให้คอมพิวเตอร์สามารถ "มองเห็น" และ "เข้าใจ" ภาพได้เหมือนมนุษย์ latent representation หรือ การนำข้อมูลไปแปลงให้อยู่ในรูปแบบที่ซับซ้อนน้อยลงแต่ยังคงความหมายเดิมไว้ ถือเป็นหัวใจสำคัญในการทำงานของแบบจำลองการเรียนรู้เชิงลึก (Deep Learning Models) มันทำหน้าที่เป็นตัวแทนข้อมูลภาพต้นฉบับในรูปแบบที่ย่อและมีความหมายมากขึ้น อย่างไรก็ตาม แม้จะมีประสิทธิภาพสูง แต่ latent representation ก็ยังคงมีความไม่แน่นอน (Uncertainty) แฝงอยู่ ความไม่แน่นอนนี้เกิดขึ้นได้จากหลายปัจจัย ไม่ว่าจะเป็นข้อมูลที่ใช้ในการฝึกฝนแบบจำลอง ความซับซ้อนของแบบจำลองเอง หรือแม้แต่สภาพแวดล้อมที่เปลี่ยนแปลงไป ## แหล่งที่มาของความไม่แน่นอน ความไม่แน่นอนใน latent representation สามารถแบ่งออกได้เป็น 2 ประเภทหลักๆ ดังนี้ 1. **Aleatoric Uncertai...

NeCo: ยกระดับการเรียนรู้ Spatial Representations ของ DINOv2 ด้วย Patch Neighbor Consistency ภายในเวลาเพียง 19 ชั่วโมงบน GPU

NeCo: ยกระดับการเรียนรู้ Spatial Representations ของ DINOv2 ด้วย Patch Neighbor Consistency ภายในเวลาเพียง 19 ชั่วโมงบน GPU NeCo: ยกระดับการเรียนรู้ Spatial Representations ของ DINOv2 ด้วย Patch Neighbor Consistency ภายในเวลาเพียง 19 ชั่วโมงบน GPU ในโลกของ Computer Vision การเรียนรู้แบบ Self-supervised Learning (SSL) ได้รับความนิยมอย่างมาก เนื่องจากสามารถเรียนรู้ข้อมูลภาพจำนวนมหาศาลได้โดยไม่จำเป็นต้องมีข้อมูลที่ถูก label ไว้ก่อน DINOv2 เป็นหนึ่งในโมเดล SSL ที่โดดเด่น มันสามารถเรียนรู้ spatial representations คุณภาพสูงจากภาพ ซึ่งเป็นประโยชน์ต่องาน downstream ต่างๆ เช่น Image Classification และ Object Detection อย่างไรก็ตาม กระบวนการฝึกฝน DINOv2 จำเป็นต้องใช้ทรัพยากรคอมพิวเตอร์มหาศาล โดยเฉพาะเวลาในการฝึกฝนบน GPU ที่อาจใช้เวลานานหลายร้อยชั่วโมง เพื่อแก้ปัญหานี้ งานวิจัย NeCo: Improving DINOv2’s spatial representations in 19 GPU hours with Patch Neighbor Consistency [1] ได้เสนอเทคนิคใหม่ที่เรียกว่า "Patch Neighbor Consistency" หรือ "NeCo" เพื่...

ZebraPose: การตรวจจับและประเมินท่าทางม้าลายโดยใช้ข้อมูลสังเคราะห์

ZebraPose: การตรวจจับและประเมินท่าทางม้าลายโดยใช้ข้อมูลสังเคราะห์ ZebraPose: การตรวจจับและประเมินท่าทางม้าลายโดยใช้ข้อมูลสังเคราะห์ ในโลกของวิทยาการคอมพิวเตอร์ การตรวจจับวัตถุและการประเมินท่าทางเป็นสิ่งสำคัญอย่างยิ่ง โดยเฉพาะอย่างยิ่งในงานวิจัยด้านวิทยาการคอมพิวเตอร์กับการอนุรักษ์สัตว์ป่า การติดตามและวิเคราะห์พฤติกรรมของสัตว์เป็นสิ่งสำคัญ แต่มักจะประสบปัญหาในการเก็บรวบรวมข้อมูล ลองนึกภาพการติดตามม้าลายในทุ่งหญ้าสะวันนาอันกว้างใหญ่ การติดตั้งกล้องและการติดตามม้าลายแต่ละตัวเป็นเรื่องที่ยากลำบากและมีค่าใช้จ่ายสูง ด้วยเหตุนี้ งานวิจัย ZebraPose จึงถูกพัฒนาขึ้นมาเพื่อแก้ปัญหานี้ โดยใช้ประโยชน์จากข้อมูลสังเคราะห์ในการตรวจจับและประเมินท่าทางของม้าลาย ซึ่งเป็นวิธีการที่น่าสนใจและมีประสิทธิภาพ ZebraPose เป็นนวัตกรรมที่ใช้เทคนิคการเรียนรู้เชิงลึก (Deep Learning) โดยอาศัยข้อมูลสังเคราะห์ที่สร้างขึ้นจากแบบจำลองสามมิติของม้าลาย แทนที่จะใช้ข้อมูลจากภาพถ่ายจริง ซึ่งเป็นข้อได้เปรียบที่สำคัญ เพราะการสร้างข้อมูลสังเคราะห์สามารถควบคุมสภาพแวดล้อม มุมกล้อง และท่าทางของม้าลายได้อย...