2 คะแนน โดย GN⁺ 2025-01-11 | 1 ความคิดเห็น | แชร์ทาง WhatsApp
  • การแสดงภาพ ISBN

    • Anna's Archive ให้บริการแคตตาล็อกหนังสือแบบเปิดที่ใหญ่ที่สุดในประวัติศาสตร์มนุษยชาติ
    • แต่ละพิกเซลแทน ISBN 2,500 รายการ และหากมีไฟล์อยู่ พิกเซลจะแสดงเป็นสีเขียว
    • มีการสำรองข้อมูลหนังสือทั้งหมดเพียง 16% เท่านั้น และยังต้องทำงานเพิ่มอีกมาก
  • ภูมิหลัง

    • Anna's Archive จัดทำแคตตาล็อกหนังสือโดยใช้หมายเลข ISBN เพื่อสำรองความรู้ของมนุษยชาติ
    • ISBN ถูกกำหนดให้กับหนังสือที่ตีพิมพ์ในประเทศส่วนใหญ่ตั้งแต่ทศวรรษ 1970
    • ระบบนี้ทำงานแบบกระจายศูนย์โดยไม่มีหน่วยงานกลาง โดยมีการจัดสรรหมายเลขตามประเทศ สำนักพิมพ์รายใหญ่ และสำนักพิมพ์รายย่อย
    • Anna's Archive สแครปข้อมูลจากแหล่งเมทาดาทาหลากหลาย เช่น ISBNdb, Worldcat, Google Books และอื่น ๆ ทำให้มีเมทาดาทาหนังสือแบบเปิดที่ใหญ่ที่สุด
    • การระบุและอนุรักษ์หนังสือหายากและหนังสือที่เสี่ยงสูญหายเป็นเรื่องสำคัญ
  • การแสดงภาพ

    • สามารถดูชุดข้อมูลต่าง ๆ แยกกันได้ และสลับได้ด้วยเมนูดรอปดาวน์และปุ่ม
    • ชุดข้อมูลประกอบด้วย Anna's Archive, Google Books, Goodreads, Internet Archive และอื่น ๆ
    • ในการแสดงภาพสามารถสังเกตรูปแบบต่าง ๆ ได้ เช่น เส้นและบล็อกที่เป็นระเบียบ รวมถึงพื้นที่ว่าง
  • เงินรางวัล $10,000

    • มีเงินรางวัลสำหรับการปรับปรุงการแสดงภาพ โดยต้องส่งโค้ดโอเพนซอร์สภายในวันที่ 31 มกราคม 2025
    • ผลงานที่ดีที่สุดจะได้รับ $6,000 อันดับสอง $3,000 และอันดับสาม $1,000 โดยจ่ายเป็น Monero(XMR)
    • แม้จะไม่ผ่านเกณฑ์ขั้นต่ำ ก็อาจยังได้รับเงินรางวัลบางส่วน
    • ผลงานที่ส่งต้องปรับแก้ HTML เพื่อพัฒนาการแสดงภาพ และต้องทำงานได้ดีทั้งบนเดสก์ท็อปและมือถือ
    • จะมีการให้คะแนนเพิ่มเติมตามการใช้งานและความน่าสนใจด้านภาพ
  • โค้ด

    • โค้ดสำหรับสร้างภาพและตัวอย่างอยู่ในไดเรกทอรีเฉพาะ
    • ใช้รูปแบบข้อมูลแบบบีบอัดขนาด 75MB เพื่อให้ข้อมูล ISBN
    • ไม่จำเป็นต้องใช้รูปแบบนี้เพื่อเข้าร่วมชิงเงินรางวัล แต่เป็นรูปแบบที่สะดวกที่สุดสำหรับการเริ่มต้น
    • โค้ดทั้งหมดต้องเผยแพร่เป็นโอเพนซอร์ส

1 ความคิดเห็น

 
GN⁺ 2025-01-11
ความคิดเห็นบน Hacker News
  • เห็นมีเงินรางวัลอยู่ด้านล่าง ดังนั้นเท่ากับผมตัดโอกาสชนะของตัวเองทิ้งไป แต่ภาพแสดงข้อมูลนี้ดูเหมาะมากที่จะแมปเข้ากับ เส้นโค้งฮิลเบิร์ต [0]
    ถ้าทำข้อมูลให้เป็น “แถบ” แบบตอนนี้ จุดที่อยู่ใกล้กันตามลำดับก็อาจอยู่ห่างกันค่อนข้างมากได้ เพราะระยะที่เลื่อนลงหนึ่งช่องบนแกน Y คือการข้ามข้อมูลไปทั้งแถว แต่ระยะบนแกน X จะสอดคล้องกับข้อมูลต้นฉบับแบบ 1:1
    ถ้าแมปเข้ากับเส้นโค้งฮิลเบิร์ต แกน X กับแกน Y เองจะไม่มีความหมายแล้ว แต่จุดที่อยู่ใกล้กันในรายการที่จัดเรียงไว้จะยังดูอยู่ใกล้กันในภาพผลลัพธ์ด้วย
    ISBN มีส่วนแรกเป็นประเทศ ส่วนที่สองเป็นสำนักพิมพ์ ส่วนที่สามเป็นชื่อเรื่อง และท้ายสุดมี checksum ดังนั้นผมน่าจะตัด checksum ออก แล้วเรียงแต่ละส่วนเป็นเลขจำนวนใหญ่โดยไม่ใส่ยัติภังค์
    แบบนั้นพื้นที่กว้าง ๆ ที่ประเทศผู้พิมพ์รายใหญ่ครอบครองจะดูเหมือน “เกาะ” และภายในเกาะนั้น รหัสสำนักพิมพ์จะปรากฏเป็นจุดสว่าง ถ้าติดป้ายกำกับให้พื้นที่เหล่านี้ด้วยก็ได้คะแนนโบนัสเลย
    ผมเคยทำการประยุกต์วิธีนี้กับข้อมูลสภาพอากาศไว้สำหรับใช้สัมภาษณ์งาน [1] ข้อมูลตามฤดูกาลถูกจัดกลุ่มเข้าด้วยกัน ทำให้เห็น seasonality ได้ชัดมาก
    [0] https://en.wikipedia.org/wiki/Hilbert_curve
    [1] https://graypegg.com/hilbert (ถ้าอยากใช้โค้ดนี้ไปลองชิงเงินรางวัล ก็ดูได้ที่ https://github.com/graypegg/hilbertcurveplayground ถ้านำกลับมาใช้ อย่างน้อยก็หวังว่าจะเอ่ยชื่อผมบ้าง แต่ผมก็ห้ามไม่ได้)

    • ยังมี เส้นโค้ง Gilbert ซึ่งเป็นเส้นโค้งฮิลเบิร์ตแบบทั่วไปสำหรับพื้นที่สี่เหลี่ยมผืนผ้าที่ไม่ใช่กำลังของ 2 [0] และมีเดโมออนไลน์ด้วย [1]
      [0] https://github.com/jakubcerveny/gilbert
      [1] https://jakubcerveny.github.io/gilbert/demo/
    • สงสัยว่าคุณสมบัติอะไรของเส้นโค้งฮิลเบิร์ตที่ทำให้มันดีกว่า เช่น แพตเทิร์นแบบงูเลื้อย เพราะในแพตเทิร์นแบบงู ISBN ที่ติดกันก็จะเป็นเพื่อนบ้านกันในภาพแสดงข้อมูลเหมือนกัน
      ผมกังวลว่าเส้นโค้งฮิลเบิร์ตจริง ๆ แล้วเป็นแค่ผลผลิตของโครงสร้างเส้นโค้ง แต่ทำให้ผลลัพธ์ดูเหมือนมีการแบ่งเขตเป็น “สี่เหลี่ยมจัตุรัส” ชัดเจนในข้อมูล [0] ในแง่นั้น ภาพแสดงข้อมูลปัจจุบันจึงมีประโยชน์กว่า เพราะเห็นตำแหน่งของแต่ละประเทศได้ทันที
      [0] https://raw.githubusercontent.com/jakubcerveny/gilbert/maste...
  • ปัญหาคือ ISBN ไม่ได้เป็นลำดับชั้น ISBN ซื้อเป็นบล็อกได้ หรือจะซื้อแยกเป็นรายเลขโดยจ่ายเงินเพิ่มแบบไร้เหตุผลก็ได้ พูดจากประสบการณ์คนที่เคยซื้อหนึ่งเลขเพื่อพิมพ์หนังสือเล่มเดียวซ้ำ
    ดังนั้นภาพแสดงข้อมูลนี้ไม่ได้แสดงอะไรที่น่าสนใจหรือมีประโยชน์เป็นพิเศษ
    ผมคิดว่าภาพแสดงข้อมูลที่ใช้การจัดหมวดหมู่ของหอสมุดรัฐสภาสหรัฐฯ หรือระบบทศนิยมดิวอี้น่าจะมีประโยชน์กว่ามาก โดยเฉพาะถ้าเชื่อมไปยังคลังและรายการหนังสือ public domain กับหนังสือที่ไม่มีข้อจำกัดด้านลิขสิทธิ์ได้ เช่น ทำเป็นเวอร์ชันอินเทอร์แอคทีฟและเป็นภาพของทรัพยากรของ John Mark Ockerbloom
    https://onlinebooks.library.upenn.edu/

    • ISBN เป็นลำดับชั้นนะ ไม่รู้ว่าหมายถึงอะไร เหมือนกอล ISBN ก็แบ่งเป็นหลายส่วน ส่วนหนึ่งคือภาษา อีกส่วนคือสำนักพิมพ์ และส่วนสุดท้ายคือชื่อเรื่อง ส่วนท้ายสุดเป็น checksum https://en.wikipedia.org/wiki/ISBN#Overview
    • ภาพแสดงข้อมูลนี้แสดงสิ่งที่มันต้องการแสดง ก็คือโดยหลัก ๆ แล้วพวกเขามีหนังสือของโลกอยู่มากแค่ไหน ไม่เกี่ยวกับ ความเป็นลำดับชั้น
    • ถ้าดูปริมาณพิกเซลสีดำ จะเห็นด้วยว่า ISBN ถูก จัดสรร เร็วกว่าความเร็วที่ถูกใช้งานจริงมาก
      ภาพมีขนาด 1000×800 พิกเซล และหนึ่งพิกเซลแทน ISBN 2500 รายการ ดังนั้นจึงแสดง ISBN 2 พันล้านรายการ ISBN-13 ประกอบด้วยเลข 12 หลักและเลขตรวจสอบ 1 หลัก ดังนั้นโดยปกติน่าจะคาดได้ว่าภาพจะใหญ่กว่าหรือหนาแน่นกว่าภาพปัจจุบัน 500 เท่า
      ขนาดปัจจุบันน่าจะหมายความว่ารวมเฉพาะ ISBN ที่มีคำนำหน้า 978 และ 979 และครึ่งล่างดูโปร่งกว่ามาก จึงน่าจะเป็นช่วง 979 ใหม่
  • ตามคำอธิบายแล้วควรจะแยกพิกเซลสีแดงกับสีเขียวได้ แต่ผมนึกว่าเพราะ ภาวะตาบอดสี เลยไม่เห็น เห็นแค่สีแดงกับสีดำ
    แต่ถึงใช้ส่วนขยายเบราว์เซอร์สำหรับแก้ภาวะตาบอดสี ก็ยังแยกสีได้ไม่มากขึ้น เลยสงสัยว่าเป็นแค่ผมหรือกราฟแปลกกันแน่

    • เผื่อเป็นข้อมูล ผมไม่ได้ตาบอดสี และเห็นพิกเซลสีแดง สีเขียว และสีดำ ดูด้วยตาเปล่าแล้วกราฟไม่ได้ดูแปลก
      ลองเลื่อนลงไปหาเครื่องมือแสดงข้อมูลแบบอินเทอร์แอคทีฟ แล้วเปลี่ยนเป็น “Files in Anna's Archive [md5]” ตำแหน่งของพิกเซลสีเขียวจะถูกไฮไลต์เป็นสีเทา
    • ถ้าคุณมี ภาวะตาบอดสีแดง-เขียว เหมือนผม ลองทำแบบนี้ได้
      คลิกขวาที่ภาพแล้วเลือก “Inspect” จากนั้นเพิ่มฟิลเตอร์ CSS hue-rotate ใหม่ให้กับ element
      element { max-width: 100%; margin: 0 auto; filter: hue-rotate(-90deg); }
      ปกติผมจะใช้ filter: saturate(100); แต่กับภาพนี้ใช้ไม่ค่อยได้ อาจต้องปรับองศาการหมุน และสำหรับผม -90 องศาเหมาะที่สุด
    • ตัวกราฟเองดูปกติ และจริง ๆ มีพิกเซลสีแดงกับสีเขียวอยู่เล็กน้อย น่าเสียดายที่ดูเหมือนจะเป็นปัญหาฝั่งส่วนขยาย
    • ผมก็ตาบอดสีเหมือนกัน และกราฟนี้ไม่ดี
    • ผมเห็นจุดสีเขียวและบางแถวที่เป็นจุดสีเขียว ลองซูมดูหรือยัง?
  • Anna's Archive เป็นหนึ่งในสิ่งมหัศจรรย์ของโลก ถ้ามนุษยชาติเกือบทำลายตัวเองจนหมด แต่ Anna's Archive ยังอยู่รอด ก็น่าจะยังมีความหวังสำหรับการสร้างใหม่ได้ค่อนข้างเร็ว

    • พูดว่า “การสร้างใหม่ได้ค่อนข้างเร็ว” แต่ถ้า การทำลายตัวเอง เป็นเงื่อนไขจำเป็นในที่นี้ มันเป็นเรื่องดีจริงหรือ?
  • IP ของเซิร์ฟเวอร์ดูเหมือนจะถูก บล็อกใน EU บนอินเทอร์เน็ต Ziggo ในเนเธอร์แลนด์มีข้อความแบบนี้ขึ้น
    “เว็บไซต์นี้ถูกบล็อก
    มาตรการคว่ำบาตรของยุโรป
    คณะมนตรีแห่งยุโรปได้ตัดสินใจว่าเว็บไซต์ RT (เดิมคือ Russia Today) และ Sputnik News ไม่ควรถูกส่งต่ออีกต่อไป เว็บไซต์ที่คุณกำลังพยายามเข้าถึงเข้าข่ายมาตรการคว่ำบาตรของยุโรปนี้
    VodafoneZiggo มีหน้าที่ต้องปฏิบัติตามมาตรการคว่ำบาตร จึงได้บล็อกเว็บไซต์นี้”

    • ในโปแลนด์เปิดได้ปกติ ใช้ลิงก์นี้แทนได้
      https://web.archive.org/web/20250106112552/https://annas-arc...
    • อัปเดต: แก้ได้แล้วโดยเปลี่ยนการตั้งค่าเซิร์ฟเวอร์ DNS ให้เซิร์ฟเวอร์ที่รันเองอยู่แล้วใช้ root DNS แทนการส่งต่อไปยัง ISP
    • ในฝรั่งเศสไม่มีปัญหา
    • การรัน recursive resolver เองก็มีข้อดีอยู่บ้าง
    • ในฟินแลนด์ไม่มีปัญหา
  • คนอื่นเห็นข้อความนี้ด้วยไหม?
    “เซิร์ฟเวอร์นี้ไม่สามารถพิสูจน์ได้ว่าตัวเองคือ annas-archive.org ใบรับรองความปลอดภัยออกให้แก่ *.hs.llnwd.net อาจเกิดจากการตั้งค่าผิดพลาด หรือผู้โจมตีกำลังดักการเชื่อมต่ออยู่”

    • ผมก็เป็นเหมือนกัน ถ้า query DNS สำหรับ annas-archive.org บนอินเทอร์เน็ต EE ในสหราชอาณาจักร จะได้ที่อยู่ www.ukispcourtorders.co.uk กลับมา และฝั่งนั้นก็ขึ้น คำเตือนด้านความปลอดภัย ด้วย
      ไม่ว่าเว็บไหน ถ้าข้ามคำเตือนเข้าไปก็จะเจอข้อผิดพลาด HTTP 400
      ตาม Wikipedia ระบุว่า www.ukispcourtorders.co.uk เคยเป็นเว็บไซต์ที่แสดงรายชื่อโดเมนที่ถูกบล็อกและคำสั่งศาลที่เกี่ยวข้อง
      https://en.wikipedia.org/wiki/List_of_websites_blocked_in_th...
    • ไม่นะ ฟังดูเหมือนฝั่งนั้นกำลังโดนโจมตีแบบ man-in-the-middle อยู่ แต่ตัวโดเมนเองดูเหมือน CDN ปกติ
    • บน DNS ของ ISP ในฟินแลนด์ ได้ใบรับรองที่ดูปกติซึ่งออกโดย Google Trust Services
    • ผมก็เหมือนกัน
  • ค่อนข้างดูยากว่าอะไรในกราฟนี้ตรงกับอะไร ถ้ามีใครช่วยระบุว่า Bookland หรือก็คือ 978 อยู่ตรงไหน น่าจะช่วยให้จับทิศทางได้ง่ายขึ้น

    • การทำให้เห็นภาพได้ง่ายขึ้นก็คือเป้าหมายของ เงินรางวัล ที่ประกาศในบทความนี้นั่นแหละ
  • การดาวน์โหลดไฟล์ ISBN ของทางนั้นมาใช้ผิดกฎหมายหรือเปล่า? ไม่เข้าใจว่าการมีข้อมูลแบบนั้นมันมีปัญหาอะไร

    • ถ้าเป็นหน้าที่ลิงก์ไปยัง libgen กับ sci-hub ก็คงไม่น่าจะใส่ใจเรื่อง ลิขสิทธิ์ ขนาดนั้น
  • เขาบอกว่า “แต่ละพิกเซลแทน ISBN 2,500 รายการ ถ้ามีไฟล์ของ ISBN นั้นอยู่ ก็ทำให้พิกเซลนั้นเขียวขึ้น” แต่ไม่เข้าใจว่า เขียวขึ้น หมายถึงอะไร ไม่เห็นสีเขียวแบบไล่เฉดเลย
    แล้วพิกเซลสีดำถือว่าเป็น ISBN ที่ยังไม่ได้จดทะเบียนใช่ไหม?

    • แนะนำให้ลองตรวจภาวะตาบอดสีดู สีเขียวชัดมาก โดยเฉพาะบริเวณราว 40% จากด้านบนของภาพรวม
    • ถ้าดูละเอียด ๆ จะเห็นแน่นอนว่ามีพิกเซลออกน้ำตาลกับพิกเซลสีเขียวเข้มอยู่บ้าง
  • มีข้อความแบบนี้ขึ้น
    “มาตรการคว่ำบาตรของยุโรป
    คณะมนตรีแห่งยุโรปได้ตัดสินใจว่าเว็บไซต์ RT (เดิมคือ Russia Today) และ Sputnik News ไม่ควรถูกส่งต่ออีกต่อไป เว็บไซต์ที่คุณกำลังพยายามเข้าถึงเข้าข่ายมาตรการคว่ำบาตรของยุโรปนี้”

    • เว็บไซต์นี้ถูกเซ็นเซอร์ที่ ระดับ DNS แต่ดูเหมือนเลือกหน้า error ผิด
      ในอิตาลีจะล้มเหลวเป็น NS_ERROR_CONNECTION_REFUSED เฉย ๆ
    • จาก IP ยุโรป ที่นี่เปิดได้ปกติ
    • เปลี่ยน DNS ไปใช้พวก 1.1.1.1 (Cloudflare) หรือ 8.8.8.8 (Google) ก็ได้