ผู้ชนะรางวัล Bounty การทำภาพข้อมูล ISBN มูลค่า $10k
(annas-archive.org)- เมื่อไม่กี่เดือนก่อน ได้ประกาศมอบเงินรางวัล $10,000 ให้กับผู้ที่สามารถสร้างภาพข้อมูลของพื้นที่ ISBN จากข้อมูลของ Anna’s Archive ได้ดีที่สุด
- ภาพข้อมูลนี้แสดงให้เห็นทั้งไฟล์ที่ถูกเก็บถาวรแล้วและยังไม่ได้เก็บถาวร พร้อมชุดข้อมูลที่ระบุจำนวนห้องสมุดที่ถือครอง ISBN แต่ละรายการ
- มีผู้เข้าร่วมจำนวนมากและนำเสนอไอเดียที่สร้างสรรค์ ความหลงใหลและพลังงานที่มีต่อโปรเจ็กต์นี้น่าประทับใจมาก
- เป้าหมายคือการทำความเข้าใจว่าจากหนังสือทั้งหมดที่มีอยู่ในโลก มีจำนวนเท่าใดที่ถูกเก็บถาวรแล้ว และหนังสือใดที่ควรให้ความสำคัญต่อไป
การทำภาพข้อมูลพื้นฐาน
- ใช้ภาพขนาดไม่เกิน 300kb เพื่อสรุป "รายการหนังสือ" ที่ใหญ่ที่สุดในประวัติศาสตร์มนุษยชาติอย่างกระชับ
- รวมแหล่งข้อมูลหลากหลาย เช่น All ISBNs, Anna’s Archive, Google Books, Internet Archive เป็นต้น
ความท้าทายและผู้ชนะ
- เดิมตั้งใจมอบรางวัลที่ 1 มูลค่า $6,000 รางวัลที่ 2 มูลค่า $3,000 และรางวัลที่ 3 มูลค่า $1,000 แต่เนื่องจากมีผู้เข้าร่วมจำนวนมาก จึงตัดสินใจมอบรางวัลที่ 3 ให้ 4 คน คนละ $500
- รางวัลที่ 1 $6,000: phiresky - โดดเด่นด้วยตัวเลือกการทำภาพข้อมูลที่ยืดหยุ่น และการทำงานที่รวดเร็วลื่นไหล
- รางวัลที่ 2 $3,000: hypha - การทำภาพข้อมูลในระดับมหภาคน่าประทับใจ และมี UI ที่ใช้งานเป็นมิตร
- รางวัลที่ 3 $500 #1: maxlion - มุมมองหลากหลาย โดยเฉพาะมุมมองเปรียบเทียบและมุมมองตามสำนักพิมพ์ที่น่าประทับใจ
- รางวัลที่ 3 $500 #2: abetusk - ฟีเจอร์การเปรียบเทียบยอดเยี่ยม
- รางวัลที่ 3 $500 #3: conundrumer0 - น่าประทับใจในฐานะเครื่องมือทำภาพข้อมูลที่ยืดหยุ่นสูง
- รางวัลที่ 3 $500 #4: charelf - มีฟังก์ชันเรียบง่ายแต่ได้ผลดี
ไอเดียที่น่าสนใจ
- BWV_1011: ตึกระฟ้าสำหรับแสดงความหายาก
- robingchan: สถิติแบบเรียลไทม์
- reguster: คำอธิบายประกอบและสถิติแบบเรียลไทม์
- orangereporter: มุมมองแผนที่และตัวกรองที่ไม่เหมือนใคร
- joe.davis: ชุดสีพื้นฐานที่สวยงามและฮีตแมป
- timharding: สลับดูข้อมูลได้ง่ายเพื่อเปรียบเทียบชุดข้อมูลอย่างรวดเร็ว
- j1618: ป้ายกำกับที่สวยงาม
- immartian: สเกลบาร์ที่แสดงจำนวนหนังสือ
- backrndsource: สไลเดอร์จำนวนมากสำหรับเปรียบเทียบชุดข้อมูลได้เหมือน DJ
บทสรุป
- มีแผนจะนำผลงานที่ได้รางวัลอันดับ 1 ไปผสานเข้ากับเว็บไซต์หลัก และกำลังพิจารณาผลงานอื่น ๆ ด้วย
- กำลังคิดหาวิธีจัดระบบกระบวนการระบุ ตรวจสอบ และเก็บถาวรหนังสือหายาก
- ขอบคุณทุกคนที่เข้าร่วม และขอบคุณที่มีผู้คนจำนวนมากให้ความสนใจกับโปรเจ็กต์นี้
1 ความคิดเห็น
ความคิดเห็นจาก Hacker News
ผลงานที่ชนะคือ งาน visualization ที่เพิ่งถูกพูดถึงบน HN ไปเมื่อไม่นานนี้
น่าประทับใจทั้งด้าน การเลือกเชิงเทคนิค และการออกแบบกราฟิก โดยแสดงภาพหนังสือ 2 พันล้านเล่มอย่างงดงามให้ดูเหมือนชั้นหนังสือ
กระทู้ HN ที่เกี่ยวข้อง: https://news.ycombinator.com/item?id=42897120
แปลกใจนิดหน่อยที่ผลงานของผมได้ อันดับ 3 น่าจะเพราะเขาชอบความเรียบง่ายและการทำ visualization
ยังดูได้ที่ https://isbnviz.pages.dev
พูดตามตรง ผมคิดว่าสองงานข้างล่างนี้ดีกว่า: https://bwv-1011.github.io/isbn-viewer/, https://anna.candyland.page/map-sample.html
โดยเฉพาะงานของ bwv แม้จะคล้ายกันในเชิงเทคนิค แต่โดยรวมดีกว่าของผมมาก และใกล้เคียงกับรูปแบบที่ผมอยากทำ
แต่ถ้าเทียบงานของคุณกับงานของ bwv ผมไม่เห็นด้วยว่า bwv เหนือกว่าทางเทคนิคในทุกด้าน
มันขาด ฟีเจอร์เปรียบเทียบ, การเลือก ISBN และการสร้างลิงก์ ส่วน bwv ดูเหมือนจะโฟกัสกับฟีเจอร์เดียวคือการไฮไลต์หนังสือหายาก แลกกับการดูแลข้อกำหนดอื่น ๆ ที่ Anna’s Archive ต้องการน้อยลง
เพราะมองจากภายนอกแล้ว นั่นดูเหมือนจะเป็นจุดประสงค์หลักของความพยายามครั้งนี้
เจ๋งมาก แต่ผมเจอจุดแปลกอย่างหนึ่ง
พอค้นหา ‘Stubborn Attachments’ ก็เจอได้ดี และบนชั้นเดียวกันมีหนังสือของ Stripe Press อยู่หลายเล่ม
ในนั้นมีหนังสือของ Stephanie Friedman ชื่อ “Zero to One Hundred” แต่พอค้นใน Amazon ชื่อกลับแสดงต่างออกไป เข้าใจได้ว่าอาจยังไม่กำหนดชื่อสุดท้ายเพราะยังไม่วางจำหน่าย: https://a.co/d/bQX5CNf
ที่แปลกคือถ้าค้นด้วยชื่อ “Zero to One Hundred” ตามที่เห็นบนชั้นกลับไม่เจอ แต่ถ้าค้นด้วย ISBN จะเจอ และชื่อในผลค้นหาก็แสดงเป็นชื่ออื่นอีก
ดังนั้นตำแหน่งเดียวกันบนชั้นจึงดูแตกต่างกันตามสิ่งที่ใช้ค้นหา ผมยังไม่ได้อ่านบล็อกว่า visualization นี้ทำงานอย่างไร เลยไม่รู้สาเหตุ
ถ้าค้น ISBN บนเว็บ จะเจอ “Zero to One Hundred” พร้อมปก “Built to Grow” และกลับกันก็เช่นเดียวกัน
อีกทั้ง ISBN เดียวกันยังปรากฏกับ “Experiment, Build, Scale” โดยผูกอยู่กับสองชื่อก่อนหน้า และใน visualization แสดงเป็นหนังสือเล่มนี้
ในบรรดาหนังสือของ Stephanie ดูเหมือนว่าใน Google Books มีแค่ “Experiment, Build, Scale” ส่วนใน Worldcat มี “Zero to One Hundred” พร้อมปก “Built to Grow”
ร้านหนังสือออนไลน์ส่วนใหญ่ก็พันกันแบบนี้ จึงดูใกล้เคียงกับปัญหา คุณภาพข้อมูล จาก upstream มากกว่า และคงโทษเครื่องมือได้ยาก
น่าสนใจ ถ้าซูมเข้าไปที่ https://archive.anarchy.cool/maps/isbn.html จะเห็นอะไรหลายอย่าง น่าเสียดายที่ดูเหมือนไม่มีลิงก์ตรงไปยังพิกัดหรือระดับการซูม
ทางตะวันออกของส่วนภาษาเยอรมันจะเจอสำนักพิมพ์อย่าง Hueber Verlag ซึ่งมีแพตเทิร์นเหมือนโปรยเลข ISBN เป็นช่วงห่างกันประมาณ 1,360,000
ผมรู้ว่า ISBN มี checksum ทำให้มีช่องว่างระหว่างหมายเลข แต่เพราะแบบนั้นมันจึงเกิดแพตเทิร์นซ้ำที่มีพื้นที่ว่างเยอะ และดูเหมือนสิ้นเปลืองช่วงเลขขนาดใหญ่ที่สำนักพิมพ์ถืออยู่มาก
ไม่มีกฎหรือว่าผู้จัดพิมพ์ควรกำหนดหมายเลขอย่างไรหรือ? ถ้ามีวิธีคืนบล็อกที่ไม่ได้ใช้และไม่จำเป็นแล้วก็คงดี
พอลองคิดว่าถ้าตีพิมพ์สื่อการเรียนรู้ใน 30 ภาษา ก็อาจมี “ไอเดีย” หลายแบบในการจัดสรร ISBN ได้เหมือนกัน: https://de.wikipedia.org/wiki/Hueber_Verlag
สำหรับ visualization ของชุดข้อมูลขนาดใหญ่ที่หวังให้ผู้ใช้ “สำรวจ” เอง ผมรู้สึกว่าส่วนใหญ่แม้จะสวย แต่ไม่ได้ให้ความเข้าใจใหม่เป็นพิเศษ
แทนที่จะสื่อสารข้อความหรือเรื่องเล่าเฉพาะ มันทำให้เราเดินดูไปเรื่อย ๆ เฉย ๆ และ visualization ครั้งนี้ก็ดูเป็นแบบนั้นเป็นพิเศษ
ถ้าไม่ได้จำลองปริมาตรสามมิติจริง ๆ แบบภาพทางการแพทย์หรือ CAD สิ่งที่ 3D เพิ่มเข้ามาอย่าง “การบังคับให้สำรวจ” ก็มีแต่ซ่อน insight เอาไว้
ข้อมูลที่สื่อได้มีเท่านั้น และไม่มี โครงสร้างลำดับชั้น ที่จะช่วยให้ค้นพบสิ่งใหม่หรือจัดระเบียบเนื้อหา
แถมข้อความเดียวกันอาจปรากฏซ้ำหลายครั้งในรูปแบบการเข้าเล่มต่างกัน ซึ่งจากมุมมองของ e-book ก็เป็นความแตกต่างที่ไม่ได้มีความหมายมากนัก
ปัญหาที่ใหญ่กว่านั้นคือ “Anna’s Archive” ไม่ใช่คลังหนังสือที่ถูกกฎหมาย แต่เป็นเว็บละเมิดลิขสิทธิ์ และสิ่งที่พวกเขาแสดงก็เป็นการอวดความครบถ้วนของการขโมยอย่างโจ่งแจ้ง รวมถึงการขาดค่าตอบแทนที่ตามมา
ถ้ามันเป็นอินเทอร์เฟซที่อิงระบบลำดับชั้นอย่าง LoC และเข้าถึงหนังสือถูกกฎหมายที่เปิดอ่านได้จริงบน https://www.gutenberg.org/ หรือหนังสือที่อยู่บน http://onlinebooks.library.upenn.edu/ รวมถึงหนังสือที่กำลังทำบน https://www.wikibooks.org/ ก็คงน่าสนใจกว่านี้มาก
ทันทีที่เห็นภาพบนสุด ผมก็รู้สึกอยากเปิดโปรแกรม จัดเรียงข้อมูลบนดิสก์ (disk defragmenter) ขึ้นมาโดยอัตโนมัติ
แค่ได้เข้าร่วมก็สนุกมากแล้ว ขอแสดงความยินดีกับทุกคนที่เกี่ยวข้อง
เผื่อใครสนใจ ผลงานที่ผมส่งเข้าประกวดยังอยู่: https://d199hl4t3ts6d9.cloudfront.net/
ขอส่งความรักอย่างจริงใจให้กับ ไลบรารีเงา (shadow libraries) ทั้งหมด พวกเขากำลังทำงานของพระเจ้าจริงๆ
ตอนดู “ชั้นหนังสือ” ของประเทศผมเองแล้วเห็นว่ามีชื่อเรื่องหายไปมากมาย ผมเศร้าเลย
ถึงขั้นทำให้อยากไปห้องสมุดท้องถิ่นด้วยตัวเอง เพื่อดิจิทัลไลซ์หนังสือเก่าๆ ที่เลิกพิมพ์และตอนนี้หาไม่ได้แล้ว
ความรู้จำนวนมากเหลือเกินกำลังหายไป
สงสัยว่าทำไมในการแสดงภาพ ISBN นี้ถึงไม่เห็น โลกภาษาสเปน ที่เด่นชัด
ภาษาอังกฤษมี 2 ช่อง ส่วนฝรั่งเศส เยอรมนี ญี่ปุ่น สหภาพโซเวียต จีน ฯลฯ ก็มีพื้นที่ใหญ่ แต่สเปนกลับไม่มีพื้นที่ใหญ่
หนังสือภาษาสเปนมีน้อยขนาดนั้นจริงหรือ? หรือการกระจายตัวเอนเอียงไปทางโลกภาษาอังกฤษเป็นหลัก?
ในฐานะคนที่โตมากับห้องสมุดและร้านหนังสือภาษาสเปน และใช้ชีวิตท่ามกลางหนังสือภาษาสเปน ผมเลยรู้สึกแปลกนิดหน่อยที่ส่วนของเราบนแผนที่โลกนี้ดูเล็กมาก
ISBN และชื่อเรื่องถูกดึงมาจากชุดข้อมูลที่ https://annas-archive.li/datasets ซึ่งส่วนใหญ่มีนิตยสารและหนังสือภาษาจีน อังกฤษ และฝรั่งเศส
ตัวอย่างเช่น เยอรมนีตีพิมพ์หนังสือมากกว่าเนเธอร์แลนด์ 5 เท่า และสเปนตีพิมพ์มากกว่าเนเธอร์แลนด์ 2 เท่า: https://internationalpublishers.org/wp-content/uploads/2023/11/IPA-Nielsen-BookData-IPA-Full-Report-23022024.pdf
แต่ในการแสดงภาพ เยอรมนีกลับดูใกล้เคียงกับเนเธอร์แลนด์ ส่วนสเปนและเม็กซิโกก็ไม่ค่อยสอดคล้องกับป้ายกำกับระดับบน: https://software.annas-archive.li/AnnaArchivist/annas-archive/-/issues/244#note_2913
มีบล็อกใหญ่บล็อกหนึ่งที่ดูเหมือน Argentina หรือ Peru และชื่อเรื่องต่างๆ อยู่ตามขอบของบล็อกใหญ่นั้น
มันไม่มีชื่อกำกับไว้ตรงกลางเหมือนบล็อกหลักอื่นๆ แต่ปล่อยว่างไว้ ถ้าทั้งบล็อกนั้นคือ Argentina ก็คงน่าแปลกใจนิดหน่อย แต่ถ้าบล็อกนั้นคือ โลกภาษาสเปน ก็ฟังดูสมเหตุสมผลทีเดียว
ผลงานชนะเลิศดูคล้ายกับตัวจัดการไฟล์ Eagle mode อยู่บ้าง ที่ต้องซูมเข้าไปเพื่อดูไฟล์ในไดเรกทอรี และซูมต่อไปเรื่อยๆ เพื่อเข้าถึงไดเรกทอรีย่อย
https://eaglemode.sourceforge.net/emvideo.html