
Data Visualize Library
LiveLibrary of data visualization technic and pattern that ready to use
Data cleaning machine for Non-technical person

Data Laundry คือ Web Application สำหรับตรวจสอบและทำความสะอาด Dataset โดยไม่ต้องเขียน Python หรือ Cleaning Script เอง
ผู้ใช้สามารถอัปโหลดไฟล์ CSV, TSV, XLSX หรือ JSON เข้ามา ตรวจดูว่าข้อมูลมีปัญหาอะไร เลือกวิธีแก้จากชุด Cleaning Tools เปรียบเทียบผลลัพธ์ก่อนและหลัง แล้วดาวน์โหลด Dataset ที่พร้อมนำไปใช้งานต่อได้ใน Workflow เดียว
ก่อนนำข้อมูลไปวิเคราะห์ สร้างรายงาน หรือป้อนเข้าสู่ระบบอื่น เรามักต้องเสียเวลากับงานเดิม ๆ เช่น ลบข้อมูลซ้ำ จัดการค่าที่หายไป แก้รูปแบบวันที่ ตัดช่องว่าง หรือรวมค่าที่เขียนไม่เหมือนกันให้เป็นมาตรฐานเดียวกัน
งานเหล่านี้ไม่ได้ซับซ้อน แต่กินเวลาและเกิดซ้ำแทบทุกครั้งที่ได้รับไฟล์ใหม่
เครื่องมืออย่าง Excel หรือ Google Sheets สามารถช่วยแก้ข้อมูลได้ แต่ยากต่อการตรวจสอบย้อนหลังและนำขั้นตอนเดิมกลับมาใช้ซ้ำ ส่วน Python และเครื่องมือด้าน Data Engineering ก็ต้องอาศัยทักษะการเขียนโค้ดมากเกินความจำเป็นสำหรับงานทำความสะอาดไฟล์ทั่วไป
ปัญหาจึงไม่ใช่แค่ว่าจะ Clean Data อย่างไร แต่คือจะทำอย่างไรให้กระบวนการนี้รวดเร็ว ตรวจสอบได้ และทำซ้ำได้โดยไม่ต้องเริ่มใหม่ทุกครั้ง
Data Laundry จึงถูกออกแบบด้วยแนวคิด Inspect. Clean. Export.
เมื่ออัปโหลด Dataset ระบบจะเริ่มจากการตรวจสุขภาพข้อมูล ทั้งค่าที่หายไป แถวซ้ำ รูปแบบที่ไม่สม่ำเสมอ ค่าที่อาจผิดปกติ และรายละเอียดของแต่ละคอลัมน์ พร้อมสรุปเป็น Health Score และแนะนำจุดที่ควรตรวจสอบ
ผู้ใช้สามารถเลือก Cleaning Tool ที่ต้องการ ตั้งค่า และดู Preview ก่อนเพิ่มแต่ละขั้นตอนเข้าไปใน Pipeline โดยระบบจะไม่แก้ข้อมูลให้อัตโนมัติโดยไม่ได้รับการยืนยัน
ทุกขั้นตอนสามารถเปิด–ปิด สลับลำดับ แก้ไข หรือนำออกได้ จึงทดลองได้โดยไม่กระทบกับข้อมูลต้นฉบับ เมื่อพอใจกับผลลัพธ์แล้วจึงตรวจสอบ Before/After และดาวน์โหลดออกเป็น CSV, XLSX หรือ JSON
Pipeline ที่ใช้บ่อยยังสามารถบันทึกเป็น Recipe เพื่อนำกระบวนการเดิมกลับมาใช้กับไฟล์ชุดใหม่ โดยไม่ต้องจำหรือทำขั้นตอนทั้งหมดซ้ำอีกครั้ง
โครงสร้างของ Data Laundry วางอยู่บนหลักการสำคัญ 5 ข้อ ได้แก่ Simple, Transparent, Modular, Reversible และ Private by Default
ระบบประมวลผล Dataset ภายใน Browser เพื่อให้ข้อมูลไม่ถูกอัปโหลดออกจากเครื่อง พร้อมแยกการทำงานหนักไปยัง Web Worker เพื่อให้หน้าจอยังตอบสนองได้ระหว่างการวิเคราะห์และประมวลผลข้อมูล
Cleaning Pipeline ทำหน้าที่เป็นแหล่งอ้างอิงหลักของการเปลี่ยนแปลงทั้งหมด ข้อมูลต้นฉบับจึงไม่ถูกแก้ไขโดยตรง และผู้ใช้สามารถย้อนกลับ จัดลำดับใหม่ หรือทดลองวิธี Clean แบบต่าง ๆ ได้ก่อน Export
Workspace รองรับไฟล์ CSV, TSV, XLSX และ JSON รวมถึง Encoding ภาษาไทย การทำงานกับ Dataset ขนาดใหญ่ผ่าน Sampling Mode การบันทึกงานไว้ใน Browser และคลัง Cleaning Techniques ที่อธิบายทั้งหลักการ ข้อควรระวัง และตัวอย่างโค้ดสำหรับผู้ที่ต้องการนำวิธีเดียวกันไปใช้ต่อ
ปัจจุบัน Data Laundry เปิดให้ทดลองใช้งานผ่าน datalaundry.lifebugs.dev แล้ว โดย Workflow หลักตั้งแต่ Upload, Inspect, Clean, Review ไปจนถึง Export สามารถใช้งานได้ครบ และไม่จำเป็นต้อง Sign in
ระบบรองรับ Cleaning Tools หลายสิบรายการ การบันทึก Pipeline เป็น Recipe และการประมวลผลข้อมูลภายใน Browser ขณะนี้อยู่ระหว่างการพัฒนา Phase 2 เพื่อเพิ่มความสามารถด้านการใช้กระบวนการซ้ำ การตรวจสอบ Outlier, Cleaning Report, Dataset History และเอกสารอธิบายเทคนิคเพิ่มเติม