2 คะแนน โดย GN⁺ 2025-02-27 | 1 ความคิดเห็น | แชร์ทาง WhatsApp
  • เมื่อไม่กี่เดือนก่อน ได้ประกาศมอบเงินรางวัล $10,000 ให้กับผู้ที่สามารถสร้างภาพข้อมูลของพื้นที่ ISBN จากข้อมูลของ Anna’s Archive ได้ดีที่สุด
  • ภาพข้อมูลนี้แสดงให้เห็นทั้งไฟล์ที่ถูกเก็บถาวรแล้วและยังไม่ได้เก็บถาวร พร้อมชุดข้อมูลที่ระบุจำนวนห้องสมุดที่ถือครอง ISBN แต่ละรายการ
  • มีผู้เข้าร่วมจำนวนมากและนำเสนอไอเดียที่สร้างสรรค์ ความหลงใหลและพลังงานที่มีต่อโปรเจ็กต์นี้น่าประทับใจมาก
  • เป้าหมายคือการทำความเข้าใจว่าจากหนังสือทั้งหมดที่มีอยู่ในโลก มีจำนวนเท่าใดที่ถูกเก็บถาวรแล้ว และหนังสือใดที่ควรให้ความสำคัญต่อไป

การทำภาพข้อมูลพื้นฐาน

  • ใช้ภาพขนาดไม่เกิน 300kb เพื่อสรุป "รายการหนังสือ" ที่ใหญ่ที่สุดในประวัติศาสตร์มนุษยชาติอย่างกระชับ
  • รวมแหล่งข้อมูลหลากหลาย เช่น All ISBNs, Anna’s Archive, Google Books, Internet Archive เป็นต้น

ความท้าทายและผู้ชนะ

  • เดิมตั้งใจมอบรางวัลที่ 1 มูลค่า $6,000 รางวัลที่ 2 มูลค่า $3,000 และรางวัลที่ 3 มูลค่า $1,000 แต่เนื่องจากมีผู้เข้าร่วมจำนวนมาก จึงตัดสินใจมอบรางวัลที่ 3 ให้ 4 คน คนละ $500
  • รางวัลที่ 1 $6,000: phiresky - โดดเด่นด้วยตัวเลือกการทำภาพข้อมูลที่ยืดหยุ่น และการทำงานที่รวดเร็วลื่นไหล
  • รางวัลที่ 2 $3,000: hypha - การทำภาพข้อมูลในระดับมหภาคน่าประทับใจ และมี UI ที่ใช้งานเป็นมิตร
  • รางวัลที่ 3 $500 #1: maxlion - มุมมองหลากหลาย โดยเฉพาะมุมมองเปรียบเทียบและมุมมองตามสำนักพิมพ์ที่น่าประทับใจ
  • รางวัลที่ 3 $500 #2: abetusk - ฟีเจอร์การเปรียบเทียบยอดเยี่ยม
  • รางวัลที่ 3 $500 #3: conundrumer0 - น่าประทับใจในฐานะเครื่องมือทำภาพข้อมูลที่ยืดหยุ่นสูง
  • รางวัลที่ 3 $500 #4: charelf - มีฟังก์ชันเรียบง่ายแต่ได้ผลดี

ไอเดียที่น่าสนใจ

  • BWV_1011: ตึกระฟ้าสำหรับแสดงความหายาก
  • robingchan: สถิติแบบเรียลไทม์
  • reguster: คำอธิบายประกอบและสถิติแบบเรียลไทม์
  • orangereporter: มุมมองแผนที่และตัวกรองที่ไม่เหมือนใคร
  • joe.davis: ชุดสีพื้นฐานที่สวยงามและฮีตแมป
  • timharding: สลับดูข้อมูลได้ง่ายเพื่อเปรียบเทียบชุดข้อมูลอย่างรวดเร็ว
  • j1618: ป้ายกำกับที่สวยงาม
  • immartian: สเกลบาร์ที่แสดงจำนวนหนังสือ
  • backrndsource: สไลเดอร์จำนวนมากสำหรับเปรียบเทียบชุดข้อมูลได้เหมือน DJ

บทสรุป

  • มีแผนจะนำผลงานที่ได้รางวัลอันดับ 1 ไปผสานเข้ากับเว็บไซต์หลัก และกำลังพิจารณาผลงานอื่น ๆ ด้วย
  • กำลังคิดหาวิธีจัดระบบกระบวนการระบุ ตรวจสอบ และเก็บถาวรหนังสือหายาก
  • ขอบคุณทุกคนที่เข้าร่วม และขอบคุณที่มีผู้คนจำนวนมากให้ความสนใจกับโปรเจ็กต์นี้

1 ความคิดเห็น

 
GN⁺ 2025-02-27
ความคิดเห็นจาก Hacker News
  • ผลงานที่ชนะคือ งาน visualization ที่เพิ่งถูกพูดถึงบน HN ไปเมื่อไม่นานนี้
    น่าประทับใจทั้งด้าน การเลือกเชิงเทคนิค และการออกแบบกราฟิก โดยแสดงภาพหนังสือ 2 พันล้านเล่มอย่างงดงามให้ดูเหมือนชั้นหนังสือ
    กระทู้ HN ที่เกี่ยวข้อง: https://news.ycombinator.com/item?id=42897120

  • แปลกใจนิดหน่อยที่ผลงานของผมได้ อันดับ 3 น่าจะเพราะเขาชอบความเรียบง่ายและการทำ visualization
    ยังดูได้ที่ https://isbnviz.pages.dev
    พูดตามตรง ผมคิดว่าสองงานข้างล่างนี้ดีกว่า: https://bwv-1011.github.io/isbn-viewer/, https://anna.candyland.page/map-sample.html
    โดยเฉพาะงานของ bwv แม้จะคล้ายกันในเชิงเทคนิค แต่โดยรวมดีกว่าของผมมาก และใกล้เคียงกับรูปแบบที่ผมอยากทำ

    • ผมก็แปลกใจเหมือนกันที่ได้อันดับ 3
      แต่ถ้าเทียบงานของคุณกับงานของ bwv ผมไม่เห็นด้วยว่า bwv เหนือกว่าทางเทคนิคในทุกด้าน
      มันขาด ฟีเจอร์เปรียบเทียบ, การเลือก ISBN และการสร้างลิงก์ ส่วน bwv ดูเหมือนจะโฟกัสกับฟีเจอร์เดียวคือการไฮไลต์หนังสือหายาก แลกกับการดูแลข้อกำหนดอื่น ๆ ที่ Anna’s Archive ต้องการน้อยลง
    • ผมสงสัยว่าทำไมในงานของพวกคุณกับงานของ bwv Spain/Italy ฯลฯ ถึงดูเหมือนเกาะลอยแยกออกมา แต่ก็ยังปรากฏร่วมอยู่ในก้อนหลักด้วย
    • ดีใจที่พูดแบบนั้น ผมเองก็แปลกใจที่ bwv-1011 ได้แค่รางวัลชมเชย ทั้งที่เขาโฟกัสเชิงเทคนิคไปที่ การแสดงภาพระดับความหายาก
      เพราะมองจากภายนอกแล้ว นั่นดูเหมือนจะเป็นจุดประสงค์หลักของความพยายามครั้งนี้
  • เจ๋งมาก แต่ผมเจอจุดแปลกอย่างหนึ่ง
    พอค้นหา ‘Stubborn Attachments’ ก็เจอได้ดี และบนชั้นเดียวกันมีหนังสือของ Stripe Press อยู่หลายเล่ม
    ในนั้นมีหนังสือของ Stephanie Friedman ชื่อ “Zero to One Hundred” แต่พอค้นใน Amazon ชื่อกลับแสดงต่างออกไป เข้าใจได้ว่าอาจยังไม่กำหนดชื่อสุดท้ายเพราะยังไม่วางจำหน่าย: https://a.co/d/bQX5CNf
    ที่แปลกคือถ้าค้นด้วยชื่อ “Zero to One Hundred” ตามที่เห็นบนชั้นกลับไม่เจอ แต่ถ้าค้นด้วย ISBN จะเจอ และชื่อในผลค้นหาก็แสดงเป็นชื่ออื่นอีก
    ดังนั้นตำแหน่งเดียวกันบนชั้นจึงดูแตกต่างกันตามสิ่งที่ใช้ค้นหา ผมยังไม่ได้อ่านบล็อกว่า visualization นี้ทำงานอย่างไร เลยไม่รู้สาเหตุ

    • ดูเหมือนไม่ใช่ปัญหาของเครื่องมือ แต่เป็น ข้อมูลหนังสือเอง ที่พันกันยุ่ง
      ถ้าค้น ISBN บนเว็บ จะเจอ “Zero to One Hundred” พร้อมปก “Built to Grow” และกลับกันก็เช่นเดียวกัน
      อีกทั้ง ISBN เดียวกันยังปรากฏกับ “Experiment, Build, Scale” โดยผูกอยู่กับสองชื่อก่อนหน้า และใน visualization แสดงเป็นหนังสือเล่มนี้
      ในบรรดาหนังสือของ Stephanie ดูเหมือนว่าใน Google Books มีแค่ “Experiment, Build, Scale” ส่วนใน Worldcat มี “Zero to One Hundred” พร้อมปก “Built to Grow”
      ร้านหนังสือออนไลน์ส่วนใหญ่ก็พันกันแบบนี้ จึงดูใกล้เคียงกับปัญหา คุณภาพข้อมูล จาก upstream มากกว่า และคงโทษเครื่องมือได้ยาก
  • น่าสนใจ ถ้าซูมเข้าไปที่ https://archive.anarchy.cool/maps/isbn.html จะเห็นอะไรหลายอย่าง น่าเสียดายที่ดูเหมือนไม่มีลิงก์ตรงไปยังพิกัดหรือระดับการซูม
    ทางตะวันออกของส่วนภาษาเยอรมันจะเจอสำนักพิมพ์อย่าง Hueber Verlag ซึ่งมีแพตเทิร์นเหมือนโปรยเลข ISBN เป็นช่วงห่างกันประมาณ 1,360,000
    ผมรู้ว่า ISBN มี checksum ทำให้มีช่องว่างระหว่างหมายเลข แต่เพราะแบบนั้นมันจึงเกิดแพตเทิร์นซ้ำที่มีพื้นที่ว่างเยอะ และดูเหมือนสิ้นเปลืองช่วงเลขขนาดใหญ่ที่สำนักพิมพ์ถืออยู่มาก
    ไม่มีกฎหรือว่าผู้จัดพิมพ์ควรกำหนดหมายเลขอย่างไรหรือ? ถ้ามีวิธีคืนบล็อกที่ไม่ได้ใช้และไม่จำเป็นแล้วก็คงดี
    พอลองคิดว่าถ้าตีพิมพ์สื่อการเรียนรู้ใน 30 ภาษา ก็อาจมี “ไอเดีย” หลายแบบในการจัดสรร ISBN ได้เหมือนกัน: https://de.wikipedia.org/wiki/Hueber_Verlag

  • สำหรับ visualization ของชุดข้อมูลขนาดใหญ่ที่หวังให้ผู้ใช้ “สำรวจ” เอง ผมรู้สึกว่าส่วนใหญ่แม้จะสวย แต่ไม่ได้ให้ความเข้าใจใหม่เป็นพิเศษ
    แทนที่จะสื่อสารข้อความหรือเรื่องเล่าเฉพาะ มันทำให้เราเดินดูไปเรื่อย ๆ เฉย ๆ และ visualization ครั้งนี้ก็ดูเป็นแบบนั้นเป็นพิเศษ

    • นั่นแหละคือปัญหาที่ผมรู้สึกกับความพยายามฝืนทำ visualization ให้เป็น 3D
      ถ้าไม่ได้จำลองปริมาตรสามมิติจริง ๆ แบบภาพทางการแพทย์หรือ CAD สิ่งที่ 3D เพิ่มเข้ามาอย่าง “การบังคับให้สำรวจ” ก็มีแต่ซ่อน insight เอาไว้
    • สิ่งที่ ISBN แมปได้ก็มีแค่สำนักพิมพ์ ชื่อที่ได้รับการจัดสรร และลำดับการตีพิมพ์โดยคร่าว ๆ
      ข้อมูลที่สื่อได้มีเท่านั้น และไม่มี โครงสร้างลำดับชั้น ที่จะช่วยให้ค้นพบสิ่งใหม่หรือจัดระเบียบเนื้อหา
      แถมข้อความเดียวกันอาจปรากฏซ้ำหลายครั้งในรูปแบบการเข้าเล่มต่างกัน ซึ่งจากมุมมองของ e-book ก็เป็นความแตกต่างที่ไม่ได้มีความหมายมากนัก
      ปัญหาที่ใหญ่กว่านั้นคือ “Anna’s Archive” ไม่ใช่คลังหนังสือที่ถูกกฎหมาย แต่เป็นเว็บละเมิดลิขสิทธิ์ และสิ่งที่พวกเขาแสดงก็เป็นการอวดความครบถ้วนของการขโมยอย่างโจ่งแจ้ง รวมถึงการขาดค่าตอบแทนที่ตามมา
      ถ้ามันเป็นอินเทอร์เฟซที่อิงระบบลำดับชั้นอย่าง LoC และเข้าถึงหนังสือถูกกฎหมายที่เปิดอ่านได้จริงบน https://www.gutenberg.org/ หรือหนังสือที่อยู่บน http://onlinebooks.library.upenn.edu/ รวมถึงหนังสือที่กำลังทำบน https://www.wikibooks.org/ ก็คงน่าสนใจกว่านี้มาก
  • ทันทีที่เห็นภาพบนสุด ผมก็รู้สึกอยากเปิดโปรแกรม จัดเรียงข้อมูลบนดิสก์ (disk defragmenter) ขึ้นมาโดยอัตโนมัติ

    • แอนิเมชันของ Windows 98 คือที่สุดแล้ว หลังจากนั้นทุกอย่างแย่หมด น่าเสียดาย
  • แค่ได้เข้าร่วมก็สนุกมากแล้ว ขอแสดงความยินดีกับทุกคนที่เกี่ยวข้อง
    เผื่อใครสนใจ ผลงานที่ผมส่งเข้าประกวดยังอยู่: https://d199hl4t3ts6d9.cloudfront.net/

  • ขอส่งความรักอย่างจริงใจให้กับ ไลบรารีเงา (shadow libraries) ทั้งหมด พวกเขากำลังทำงานของพระเจ้าจริงๆ

    • พวกเขาทำไปครึ่งหนึ่งของงานแล้ว และแค่ครึ่งนั้นก็ยิ่งใหญ่มาก อีกครึ่งหนึ่งเป็นงานของอาสาสมัครที่ช่วยดิจิทัลไลซ์หนังสือ
      ตอนดู “ชั้นหนังสือ” ของประเทศผมเองแล้วเห็นว่ามีชื่อเรื่องหายไปมากมาย ผมเศร้าเลย
      ถึงขั้นทำให้อยากไปห้องสมุดท้องถิ่นด้วยตัวเอง เพื่อดิจิทัลไลซ์หนังสือเก่าๆ ที่เลิกพิมพ์และตอนนี้หาไม่ได้แล้ว
      ความรู้จำนวนมากเหลือเกินกำลังหายไป
  • สงสัยว่าทำไมในการแสดงภาพ ISBN นี้ถึงไม่เห็น โลกภาษาสเปน ที่เด่นชัด
    ภาษาอังกฤษมี 2 ช่อง ส่วนฝรั่งเศส เยอรมนี ญี่ปุ่น สหภาพโซเวียต จีน ฯลฯ ก็มีพื้นที่ใหญ่ แต่สเปนกลับไม่มีพื้นที่ใหญ่
    หนังสือภาษาสเปนมีน้อยขนาดนั้นจริงหรือ? หรือการกระจายตัวเอนเอียงไปทางโลกภาษาอังกฤษเป็นหลัก?
    ในฐานะคนที่โตมากับห้องสมุดและร้านหนังสือภาษาสเปน และใช้ชีวิตท่ามกลางหนังสือภาษาสเปน ผมเลยรู้สึกแปลกนิดหน่อยที่ส่วนของเราบนแผนที่โลกนี้ดูเล็กมาก

    • ชุดข้อมูลประกอบด้วยหนังสือที่อยู่ใน Anna’s Archive และหนังสือแต่ละเล่มถูกระบุด้วย ISBN
      ISBN และชื่อเรื่องถูกดึงมาจากชุดข้อมูลที่ https://annas-archive.li/datasets ซึ่งส่วนใหญ่มีนิตยสารและหนังสือภาษาจีน อังกฤษ และฝรั่งเศส
      ตัวอย่างเช่น เยอรมนีตีพิมพ์หนังสือมากกว่าเนเธอร์แลนด์ 5 เท่า และสเปนตีพิมพ์มากกว่าเนเธอร์แลนด์ 2 เท่า: https://internationalpublishers.org/wp-content/uploads/2023/11/IPA-Nielsen-BookData-IPA-Full-Report-23022024.pdf
      แต่ในการแสดงภาพ เยอรมนีกลับดูใกล้เคียงกับเนเธอร์แลนด์ ส่วนสเปนและเม็กซิโกก็ไม่ค่อยสอดคล้องกับป้ายกำกับระดับบน: https://software.annas-archive.li/AnnaArchivist/annas-archive/-/issues/244#note_2913
    • ผมเองก็สงสัยเหมือนกันเป๊ะ และไม่มีหลักฐานเลย แต่มีสมมติฐานหนึ่ง
      มีบล็อกใหญ่บล็อกหนึ่งที่ดูเหมือน Argentina หรือ Peru และชื่อเรื่องต่างๆ อยู่ตามขอบของบล็อกใหญ่นั้น
      มันไม่มีชื่อกำกับไว้ตรงกลางเหมือนบล็อกหลักอื่นๆ แต่ปล่อยว่างไว้ ถ้าทั้งบล็อกนั้นคือ Argentina ก็คงน่าแปลกใจนิดหน่อย แต่ถ้าบล็อกนั้นคือ โลกภาษาสเปน ก็ฟังดูสมเหตุสมผลทีเดียว
  • ผลงานชนะเลิศดูคล้ายกับตัวจัดการไฟล์ Eagle mode อยู่บ้าง ที่ต้องซูมเข้าไปเพื่อดูไฟล์ในไดเรกทอรี และซูมต่อไปเรื่อยๆ เพื่อเข้าถึงไดเรกทอรีย่อย
    https://eaglemode.sourceforge.net/emvideo.html