การแสดงภาพ ISBN ทั้งหมด
(annas-archive.org)-
การแสดงภาพ ISBN
- Anna's Archive ให้บริการแคตตาล็อกหนังสือแบบเปิดที่ใหญ่ที่สุดในประวัติศาสตร์มนุษยชาติ
- แต่ละพิกเซลแทน ISBN 2,500 รายการ และหากมีไฟล์อยู่ พิกเซลจะแสดงเป็นสีเขียว
- มีการสำรองข้อมูลหนังสือทั้งหมดเพียง 16% เท่านั้น และยังต้องทำงานเพิ่มอีกมาก
-
ภูมิหลัง
- Anna's Archive จัดทำแคตตาล็อกหนังสือโดยใช้หมายเลข ISBN เพื่อสำรองความรู้ของมนุษยชาติ
- ISBN ถูกกำหนดให้กับหนังสือที่ตีพิมพ์ในประเทศส่วนใหญ่ตั้งแต่ทศวรรษ 1970
- ระบบนี้ทำงานแบบกระจายศูนย์โดยไม่มีหน่วยงานกลาง โดยมีการจัดสรรหมายเลขตามประเทศ สำนักพิมพ์รายใหญ่ และสำนักพิมพ์รายย่อย
- Anna's Archive สแครปข้อมูลจากแหล่งเมทาดาทาหลากหลาย เช่น ISBNdb, Worldcat, Google Books และอื่น ๆ ทำให้มีเมทาดาทาหนังสือแบบเปิดที่ใหญ่ที่สุด
- การระบุและอนุรักษ์หนังสือหายากและหนังสือที่เสี่ยงสูญหายเป็นเรื่องสำคัญ
-
การแสดงภาพ
- สามารถดูชุดข้อมูลต่าง ๆ แยกกันได้ และสลับได้ด้วยเมนูดรอปดาวน์และปุ่ม
- ชุดข้อมูลประกอบด้วย Anna's Archive, Google Books, Goodreads, Internet Archive และอื่น ๆ
- ในการแสดงภาพสามารถสังเกตรูปแบบต่าง ๆ ได้ เช่น เส้นและบล็อกที่เป็นระเบียบ รวมถึงพื้นที่ว่าง
-
เงินรางวัล $10,000
- มีเงินรางวัลสำหรับการปรับปรุงการแสดงภาพ โดยต้องส่งโค้ดโอเพนซอร์สภายในวันที่ 31 มกราคม 2025
- ผลงานที่ดีที่สุดจะได้รับ $6,000 อันดับสอง $3,000 และอันดับสาม $1,000 โดยจ่ายเป็น Monero(XMR)
- แม้จะไม่ผ่านเกณฑ์ขั้นต่ำ ก็อาจยังได้รับเงินรางวัลบางส่วน
- ผลงานที่ส่งต้องปรับแก้ HTML เพื่อพัฒนาการแสดงภาพ และต้องทำงานได้ดีทั้งบนเดสก์ท็อปและมือถือ
- จะมีการให้คะแนนเพิ่มเติมตามการใช้งานและความน่าสนใจด้านภาพ
-
โค้ด
- โค้ดสำหรับสร้างภาพและตัวอย่างอยู่ในไดเรกทอรีเฉพาะ
- ใช้รูปแบบข้อมูลแบบบีบอัดขนาด 75MB เพื่อให้ข้อมูล ISBN
- ไม่จำเป็นต้องใช้รูปแบบนี้เพื่อเข้าร่วมชิงเงินรางวัล แต่เป็นรูปแบบที่สะดวกที่สุดสำหรับการเริ่มต้น
- โค้ดทั้งหมดต้องเผยแพร่เป็นโอเพนซอร์ส
1 ความคิดเห็น
ความคิดเห็นบน Hacker News
เห็นมีเงินรางวัลอยู่ด้านล่าง ดังนั้นเท่ากับผมตัดโอกาสชนะของตัวเองทิ้งไป แต่ภาพแสดงข้อมูลนี้ดูเหมาะมากที่จะแมปเข้ากับ เส้นโค้งฮิลเบิร์ต [0]
ถ้าทำข้อมูลให้เป็น “แถบ” แบบตอนนี้ จุดที่อยู่ใกล้กันตามลำดับก็อาจอยู่ห่างกันค่อนข้างมากได้ เพราะระยะที่เลื่อนลงหนึ่งช่องบนแกน Y คือการข้ามข้อมูลไปทั้งแถว แต่ระยะบนแกน X จะสอดคล้องกับข้อมูลต้นฉบับแบบ 1:1
ถ้าแมปเข้ากับเส้นโค้งฮิลเบิร์ต แกน X กับแกน Y เองจะไม่มีความหมายแล้ว แต่จุดที่อยู่ใกล้กันในรายการที่จัดเรียงไว้จะยังดูอยู่ใกล้กันในภาพผลลัพธ์ด้วย
ISBN มีส่วนแรกเป็นประเทศ ส่วนที่สองเป็นสำนักพิมพ์ ส่วนที่สามเป็นชื่อเรื่อง และท้ายสุดมี checksum ดังนั้นผมน่าจะตัด checksum ออก แล้วเรียงแต่ละส่วนเป็นเลขจำนวนใหญ่โดยไม่ใส่ยัติภังค์
แบบนั้นพื้นที่กว้าง ๆ ที่ประเทศผู้พิมพ์รายใหญ่ครอบครองจะดูเหมือน “เกาะ” และภายในเกาะนั้น รหัสสำนักพิมพ์จะปรากฏเป็นจุดสว่าง ถ้าติดป้ายกำกับให้พื้นที่เหล่านี้ด้วยก็ได้คะแนนโบนัสเลย
ผมเคยทำการประยุกต์วิธีนี้กับข้อมูลสภาพอากาศไว้สำหรับใช้สัมภาษณ์งาน [1] ข้อมูลตามฤดูกาลถูกจัดกลุ่มเข้าด้วยกัน ทำให้เห็น seasonality ได้ชัดมาก
[0] https://en.wikipedia.org/wiki/Hilbert_curve
[1] https://graypegg.com/hilbert (ถ้าอยากใช้โค้ดนี้ไปลองชิงเงินรางวัล ก็ดูได้ที่ https://github.com/graypegg/hilbertcurveplayground ถ้านำกลับมาใช้ อย่างน้อยก็หวังว่าจะเอ่ยชื่อผมบ้าง แต่ผมก็ห้ามไม่ได้)
[0] https://github.com/jakubcerveny/gilbert
[1] https://jakubcerveny.github.io/gilbert/demo/
ผมกังวลว่าเส้นโค้งฮิลเบิร์ตจริง ๆ แล้วเป็นแค่ผลผลิตของโครงสร้างเส้นโค้ง แต่ทำให้ผลลัพธ์ดูเหมือนมีการแบ่งเขตเป็น “สี่เหลี่ยมจัตุรัส” ชัดเจนในข้อมูล [0] ในแง่นั้น ภาพแสดงข้อมูลปัจจุบันจึงมีประโยชน์กว่า เพราะเห็นตำแหน่งของแต่ละประเทศได้ทันที
[0] https://raw.githubusercontent.com/jakubcerveny/gilbert/maste...
ปัญหาคือ ISBN ไม่ได้เป็นลำดับชั้น ISBN ซื้อเป็นบล็อกได้ หรือจะซื้อแยกเป็นรายเลขโดยจ่ายเงินเพิ่มแบบไร้เหตุผลก็ได้ พูดจากประสบการณ์คนที่เคยซื้อหนึ่งเลขเพื่อพิมพ์หนังสือเล่มเดียวซ้ำ
ดังนั้นภาพแสดงข้อมูลนี้ไม่ได้แสดงอะไรที่น่าสนใจหรือมีประโยชน์เป็นพิเศษ
ผมคิดว่าภาพแสดงข้อมูลที่ใช้การจัดหมวดหมู่ของหอสมุดรัฐสภาสหรัฐฯ หรือระบบทศนิยมดิวอี้น่าจะมีประโยชน์กว่ามาก โดยเฉพาะถ้าเชื่อมไปยังคลังและรายการหนังสือ public domain กับหนังสือที่ไม่มีข้อจำกัดด้านลิขสิทธิ์ได้ เช่น ทำเป็นเวอร์ชันอินเทอร์แอคทีฟและเป็นภาพของทรัพยากรของ John Mark Ockerbloom
https://onlinebooks.library.upenn.edu/
ภาพมีขนาด 1000×800 พิกเซล และหนึ่งพิกเซลแทน ISBN 2500 รายการ ดังนั้นจึงแสดง ISBN 2 พันล้านรายการ ISBN-13 ประกอบด้วยเลข 12 หลักและเลขตรวจสอบ 1 หลัก ดังนั้นโดยปกติน่าจะคาดได้ว่าภาพจะใหญ่กว่าหรือหนาแน่นกว่าภาพปัจจุบัน 500 เท่า
ขนาดปัจจุบันน่าจะหมายความว่ารวมเฉพาะ ISBN ที่มีคำนำหน้า 978 และ 979 และครึ่งล่างดูโปร่งกว่ามาก จึงน่าจะเป็นช่วง 979 ใหม่
ตามคำอธิบายแล้วควรจะแยกพิกเซลสีแดงกับสีเขียวได้ แต่ผมนึกว่าเพราะ ภาวะตาบอดสี เลยไม่เห็น เห็นแค่สีแดงกับสีดำ
แต่ถึงใช้ส่วนขยายเบราว์เซอร์สำหรับแก้ภาวะตาบอดสี ก็ยังแยกสีได้ไม่มากขึ้น เลยสงสัยว่าเป็นแค่ผมหรือกราฟแปลกกันแน่
ลองเลื่อนลงไปหาเครื่องมือแสดงข้อมูลแบบอินเทอร์แอคทีฟ แล้วเปลี่ยนเป็น “Files in Anna's Archive [md5]” ตำแหน่งของพิกเซลสีเขียวจะถูกไฮไลต์เป็นสีเทา
คลิกขวาที่ภาพแล้วเลือก “Inspect” จากนั้นเพิ่มฟิลเตอร์ CSS hue-rotate ใหม่ให้กับ element
element { max-width: 100%; margin: 0 auto; filter: hue-rotate(-90deg); }ปกติผมจะใช้
filter: saturate(100);แต่กับภาพนี้ใช้ไม่ค่อยได้ อาจต้องปรับองศาการหมุน และสำหรับผม -90 องศาเหมาะที่สุดAnna's Archive เป็นหนึ่งในสิ่งมหัศจรรย์ของโลก ถ้ามนุษยชาติเกือบทำลายตัวเองจนหมด แต่ Anna's Archive ยังอยู่รอด ก็น่าจะยังมีความหวังสำหรับการสร้างใหม่ได้ค่อนข้างเร็ว
IP ของเซิร์ฟเวอร์ดูเหมือนจะถูก บล็อกใน EU บนอินเทอร์เน็ต Ziggo ในเนเธอร์แลนด์มีข้อความแบบนี้ขึ้น
“เว็บไซต์นี้ถูกบล็อก
มาตรการคว่ำบาตรของยุโรป
คณะมนตรีแห่งยุโรปได้ตัดสินใจว่าเว็บไซต์ RT (เดิมคือ Russia Today) และ Sputnik News ไม่ควรถูกส่งต่ออีกต่อไป เว็บไซต์ที่คุณกำลังพยายามเข้าถึงเข้าข่ายมาตรการคว่ำบาตรของยุโรปนี้
VodafoneZiggo มีหน้าที่ต้องปฏิบัติตามมาตรการคว่ำบาตร จึงได้บล็อกเว็บไซต์นี้”
https://web.archive.org/web/20250106112552/https://annas-arc...
คนอื่นเห็นข้อความนี้ด้วยไหม?
“เซิร์ฟเวอร์นี้ไม่สามารถพิสูจน์ได้ว่าตัวเองคือ annas-archive.org ใบรับรองความปลอดภัยออกให้แก่ *.hs.llnwd.net อาจเกิดจากการตั้งค่าผิดพลาด หรือผู้โจมตีกำลังดักการเชื่อมต่ออยู่”
ไม่ว่าเว็บไหน ถ้าข้ามคำเตือนเข้าไปก็จะเจอข้อผิดพลาด HTTP 400
ตาม Wikipedia ระบุว่า www.ukispcourtorders.co.uk เคยเป็นเว็บไซต์ที่แสดงรายชื่อโดเมนที่ถูกบล็อกและคำสั่งศาลที่เกี่ยวข้อง
https://en.wikipedia.org/wiki/List_of_websites_blocked_in_th...
ค่อนข้างดูยากว่าอะไรในกราฟนี้ตรงกับอะไร ถ้ามีใครช่วยระบุว่า Bookland หรือก็คือ 978 อยู่ตรงไหน น่าจะช่วยให้จับทิศทางได้ง่ายขึ้น
การดาวน์โหลดไฟล์ ISBN ของทางนั้นมาใช้ผิดกฎหมายหรือเปล่า? ไม่เข้าใจว่าการมีข้อมูลแบบนั้นมันมีปัญหาอะไร
เขาบอกว่า “แต่ละพิกเซลแทน ISBN 2,500 รายการ ถ้ามีไฟล์ของ ISBN นั้นอยู่ ก็ทำให้พิกเซลนั้นเขียวขึ้น” แต่ไม่เข้าใจว่า เขียวขึ้น หมายถึงอะไร ไม่เห็นสีเขียวแบบไล่เฉดเลย
แล้วพิกเซลสีดำถือว่าเป็น ISBN ที่ยังไม่ได้จดทะเบียนใช่ไหม?
มีข้อความแบบนี้ขึ้น
“มาตรการคว่ำบาตรของยุโรป
คณะมนตรีแห่งยุโรปได้ตัดสินใจว่าเว็บไซต์ RT (เดิมคือ Russia Today) และ Sputnik News ไม่ควรถูกส่งต่ออีกต่อไป เว็บไซต์ที่คุณกำลังพยายามเข้าถึงเข้าข่ายมาตรการคว่ำบาตรของยุโรปนี้”
ในอิตาลีจะล้มเหลวเป็น NS_ERROR_CONNECTION_REFUSED เฉย ๆ