ย้ายบล็อกไปที่ bact.cc แล้วนะครับ

พ.ร.บ.คอมพิวเตอร์
หยุด ร่างพ.ร.บ.คอมพิวเตอร์
พื้นที่เก็บข้อมูลออนไลน์ ฟรี 2GB จาก Dropbox (sync กับ Windows, Linux, Mac, iPhone, Android ฯลฯ ได้)
Showing posts with label metadata. Show all posts
Showing posts with label metadata. Show all posts

2009-06-02

on various things, digital this and information that

[ปรับปรุง 12:46: เพิ่ม Greenstone และลิงก์ libraryhub.in.th ขอบคุณ @markpeak]

[ปรับปรุง 2009.07.17: แก้ไขข้อมูลเกี่ยวกับระบบบรรณารักษ์ที่คลาดเคลื่อน ขอบคุณ อ.บุญเลิศ]

สี่ห้าวันที่ผ่านมา บุกตะลุยเก็บข้อมูลเกี่ยวกับห้องสมุดและระบบสารสนเทศดิจิทัลให้ :=3

ไม่ได้เน้นไปที่พวก Library 2.0 มากนัก อยากรู้เรื่องระบบข้างใต้เพิ่มเติมมากกว่า การประยุกต์ข้างบนคิดว่าพอเข้าใจไอเดียบ้างแล้วส่วนหนึ่ง (ลองดู นำเสนอโดย @iteau และ @projectlib เกี่ยวกับเรื่องนี้และ TCDC Resource Center - @iteau เขียนควันหลงนิดนึง) เดี๋ยวลองเอามาประกอบกัน

เว็บ DegreeTutor แนะนำโอเพ่นซอร์ส ILS (integrated library system) 3 ตัว ได้แก่ Koha, Evergreen ILS, และ VuFind ทุกตัวทำงานกับ OPAC (open public access catalog) ได้หมด :

  • Koha เป็น ILS ที่ติดตั้งง่าย มีหลายที่ในเมืองไทยใช้แล้ว เช่น ห้องสมุดดิจิทัลของ STKS (โชว์ในงาน LibCamp), ห้องสมุดวุฒิสภา, ม.อุบลก็กำลังเตรียมใช้, บล็อก STKS สวทช. เขียนถึงเยอะเหมือนกัน
  • Evergreen ILS เขาว่าเป็นระบบ fault-tolerance เลยทีเดียว มั่นใจได้
  • VuFind เป็น Library Resource Portal ที่มาครอบ ILS เพื่อขยายความสามารถของ OPAC ให้เป็น OPAC 2.0 [อ.บุญเลิศ] ยังอยู่ในช่วงพัฒนา (RC) อาจจะยังไม่เรียบร้อยนัก แต่มีความสามารถเยอะ ใช้ระบบค้นหาของ Apache Solr หายห่วง โครงการห้องสมุดดิจิทัลคิดดี กำลังเล็งว่าอาจจะเอามาเป็นหน้ากากครอบฐานข้อมูลย่อย ๆ ต่าง เพื่อให้ผู้ใช้ใช้งานง่ายขึ้น

เสริมจากความเห็นโดย อ.บุญเลิศ คือ ทั้ง Koha และ Evergreen นั้น เป็น ILS ที่มีความสามารถเทียบเท่ากับ ILS ที่ขายกัน ระดับ VTLS, InnoPAC/Millenium ILS, และ Horizon/SirsiDynix

ส่วน ILS รุ่นเล็กลงไป คือ OpenBiblio และ PHPMyLibrary

งานหลักอันนึงของห้องสมุดก็คือ การทำ catalog หนังสือ หรือป้อนข้อมูลหนังสือเข้าไปในระบบ เพื่อให้สืบค้นและยืมคืนได้ ซึ่งก็ใช้แรงงานไม่น้อย ถ้ามีเครื่องทุ่นแรงก็คงจะดี นึกไอเดียประมาณ CDDB หรือ freeDB.org ที่เราเสียบซีดีเพลงเข้าเครื่อง แล้วโปรแกรมเล่นเพลงก็จะไปค้นฐานข้อมูลที่คนอื่นเขาใส่ข้อมูลชื่อเพลงชื่อนักร้องไว้เราแล้ว เราไม่ต้องใส่เองหมด เว้นว่าหาไม่เจอ เราก็ใส่เข้าไปหน่อย แล้วคนอื่นจะได้ใช้ด้วย เอาแบบนั้น สำหรับเมตาดาต้าหนังสือ ก็จะได้ ‡biblios.net โครงการเพิ่งเริ่มได้ไม่นาน แต่ดูดีทีเดียว มาจาก LibLime ผู้ร่วมพัฒนา Koha

นอกจากสารสนเทศที่เป็นหนังสือเล่มแล้ว ก็ยังมีเอกสารที่ไม่ใช่หนังสือ ซึงตอนนี้ก็เป็นดิจิทัลได้จำนวนมากแล้ว วิธีหนึ่งที่นิยมและมีประสิทธิภาพก็คือ self-archiving คือเก็บของใครของมัน ใครผลิตคนนั้นก็เก็บ เป็น institutional repository แต่แชร์ข้อมูลค้นหากันได้ ระบบจัดเก็บสารสนเทศองค์กรที่เป็นโอเพ่นซอร์สและใช้โปรโตคอล OAI-PMH สำหรับแลกเปลี่ยนเมตาดาต้าเพื่อการค้นหา มีสองตัว :

  • DSpace เมืองไทยมีใช้หลายที่ เช่น คลังปัญญาจุฬาฯ โดย สถาบันวิทยบริการ จุฬาลงกรณ์มหาวิทยาลัย, ห้องสมุดดิจิทัลคิดดี โดย เอไอที, สำนักงานคณะกรรมการการศึกษาขั้นพื้นฐาน และ มศว., NSTDA Knowledge Repository (สวทช.) โดย ศูนย์บริการความรู้ทางวิทยาศาสตร์และเทคโนโลยี
  • EPrints เมืองไทยเท่าที่ทราบ ไม่มีใครใช้ ผมดูแล้วมันน่าจะลงง่ายกว่าแฮะ (จากประสบการณ์ส่วนตัว ระหว่าง UIMA กับ GATE พบว่า GATE ปวดหัวน้อยกว่า ผมเลยคิดว่า จะลอง EPrints ก่อนละกัน เหตุผลแถ ๆ :p)

@markpeak แนะนำอีกตัว (thx!) คือ Greenstone เท่าที่ค้น ๆ ดูคร่าว ๆ อันนี้ ไม่ได้เป็น institutional repository software เหมือนกับ DSpace หรือ EPrints เสียทีเดียว แต่เป็น digital library software (ดูจากบล็อกนี้ ผมเองก็ยังตอบไม่ได้ว่า แต่ละอย่างมันต่างกันชัด ๆ อย่างไร คิดว่ามันก็ทับ ๆ กันอยู่เยอะ แต่กรณีของ IR นี่ เรื่อง self-archiving น่าจะเป็นลักษณะสำคัญอันนึง) Greenstone นี่น่าสนใจมาก เขาบอกว่าสนับสนุนหลายภาษา มีภาษาไทยด้วย (ยังไม่ได้ค้นต่อว่าที่ว่า สนับสนุนภาษา เนี่ย แปลว่าอะไร) มี UNESCO หนุน โอเพ่นซอร์ส และสนับสนุนโปรโตคอล OAI-PMH ร่วมพัฒนาโดยมหาลัยที่สร้าง WEKA data mining workbench/toolkit ดูดีนะเนี่ย

open archives, collections, repositories, libraries พวกนี้ นอกจากจะเปิดให้ดูเฉย ๆ แล้ว ถ้าจะให้มีประโยชน์จริง ๆ มันก็ควรจะค้นหาได้แบบ programmable หน่อย หรืออย่างน้อยก็มีวิธีในการค้นหาเหมือน ๆ กันนิดนึง ผู้ใช้จะได้ไม่ต้องเรียนรู้เยอะ ก็เลยเป็นที่มาของมาตรฐานในการค้นหา รวมไปถึงการแลกเปลี่ยนเมตาดาต้าแบบอัตโนมัติด้วย

เอาง่ายที่สุด ก็น่าจะใช้ OpenSearch สืบค้นได้ (ถ้านึกไม่ออกว่า OpenSearch คืออะไร ตัวช่องค้นหาบนแถบเครื่องมือใน Internet Explorer 7+ และ Mozilla Firefox 3+ ต่างก็สืบค้นจากบริการที่เราระบุ ผ่าน OpenSearch ... อืม ยังไม่ชัด แต่ก็ดูใกล้ตัวหน่อยนึง) แล้วส่งผลลัพธ์ออกมาเป็น RSS/Atom รูปแบบข้อมูลยอดนิยม, ถ้ามี JSON ล่ะก็แจ๋ว ในแง่การเขียนโปรแกรมโดยเฉพาะฝั่ง browser-side

ชุดต่อมา มาจากกลุ่ม Open Archives Initiative มีตัวชูโรงคือ OAI-PMH ที่พูดถึงก่อนหน้านี้ เอาไว้แลกเปลี่ยนเมตาดาต้า :

สำหรับการสืบค้นสารสนเทศ ดูมาตรฐาน Z39.50 (ISO 23950: Information Retrieval (Z39.50): Application Service Definition and Protocol Specification) และ SRU (Search/Retrieve via URL) คู่กับ CQL (Contextual Query Language). ‡biblios.net ที่พูดถึงก่อนหน้านี้ รองรับ SRU/CQL ด้วย

ข้อกำหนดเมตาดาต้าที่ได้รับนิยมนำไปปรับใช้มากที่สุดในเว็บนั้น คือ Dublin Core Metadata Initiative (DMCI) ซึ่งคนที่ใช้งานเอกสาร XML ต่าง ๆ อาจจะพอคุ้นเคย ใน namespace dc: ซึ่งถูกนำไปใช้กับรูปแบบเอกสาร XML หลายชนิด OAI เองก็ใช้ Dublin Core

ความเห็นเพิ่มเติมจาก อ.บุญเลิศ ขณะนี้ DCMI ก็ยอมรับแล้วว่า DC ไม่ใช่มาตรฐานเดียวที่ใช้ได้ มีการทำ Cross กับเมทาดาทาอื่นแล้ว ลองหาอ่านได้จาก DC conference ต่างๆ ได้ครับ

สำหรับรูปแบบข้อมูลผลลัพธ์จากการสืบค้นสารสนเทศอื่น ๆ ก็เช่น MARCXML ซึ่งพัฒนาต่อมาจากปู่ MARC มีช่องข้อมูลมากมาย เรียกได้ว่าครบถ้วน แต่ก็ซับซ้อนปวดหัว, ต่อมาจึงมี Metadata Object Description Schema (MODS) ซึ่งอยู่ระหว่างกลาง MARC กับ Dublin Core (ซึ่งมีช่องข้อมูลน้อยมาก ๆ ประมาณว่าใช้ได้กับงานอย่าง RSS Feed จะให้ใช้กับห้องสมุดก็ขาดตกไปหลายอย่าง) เรียกว่า MODS มีช่องข้อมูลที่จำเป็นต้องใช้บ่อย ๆ ในงานห้องสมุด ในขณะเดียวกันก็ไม่ซับซ้อนจนเกินไป, Metadata Authority Description Schema (MADS) เป็นมาตรฐานที่ออกมาใช้คู่กับ MODS

acronyms ที่พ่นออกมามากมายข้างบน เกินครึ่งกำหนดโดยห้องสมุดรัฐสภาสหรัฐ (Library of Congress) ที่เหลือก็โดยห้องสมุดของมหาวิทยาลัยหรือศูนย์วิจัยต่าง ๆ

ใครสนใจเรื่องพวกนี้ โดยเฉพาะที่ใช้โอเพ่นซอร์ส อัปเดตข่าวสารได้จากเว็บไซต์เหล่านี้ (แนะนำเพิ่มเติมได้)

  • oss4lib - Open Source Systems for Libraries
  • code4lib - coders for libraries, libraries for coders กลุ่มเป้าหมายจะเน้นนักพัฒนามากกว่า oss4lib
  • บล็อก STKS - ภาษาไทย มีเรื่องการจัดการความรู้ เรื่องห้องสมุดดิจิทัลอยู่เรื่อย ๆ โดยเฉพาะซอฟต์แวร์ที่เป็นโอเพ่นซอร์ส
  • LibraryHub - โดย @projectlib เรื่องห้องสมุดในแง่มุมต่าง ๆ (ไม่ได้เน้นเฉพาะเรื่องซอฟต์แวร์)

นอกจากเรื่อง digital repositories แล้วถ้ามีเรื่องการอนุรักษ์ preservation, digitization ควรดู TEI ไว้ด้วย Text Encoding Initiative เป็นชุดข้อแนะนำในการบันทึกข้อความมาอยู่ในระบบดิจิทัล พร้อม ๆ กับคำแนะนำในการบันทึกคำอธิบายข้อมูลต่าง ๆ (annotation) ด้วย การทำ archiving, preservation ในลักษณะนี้ ถือเป็นคีย์สำคัญสำหรับ สาขา ที่เรียกว่า digital humanities (มนุษยศาสตร์ดิจิทัล) ซึ่งส่วนหนึ่งเป็นการใช้เครื่องมือดิจิทัลศึกษาเอกสาร (และบันทึกผลการวิเคราะห์ไปเป็น annotation อีกชั้น layer นึงบนเอกสาร)

เอ้อ ถ้าอยากทำ OCR มีทูลคิตโอเพ่นซอร์สชื่อ OCRopus ลองแล้ว ใช้ได้เลย มันเชื่อมชิ้นส่วนที่จำเป็นในงาน OCR เข้าด้วยกัน ทั้งส่วนแปลงไฟล์ฟอร์แมต หมุนรูป ทำ layout analysis ทำตัวแบบภาษา และการแปลงภาพเป็นตัวอักษร ตัว engine ที่ใช้แปลงภาพเป็นตัวอักษร ตอนนี้ใช้ tesseract อยู่ โอเพ่นซอร์สเช่นกัน ทั้งหมดนี้เขียนด้วย C แต่มี Python binding ถ้าต้องการ ชุด OCRopus และ tesseract นี้มี Google สนับสนุนการวิจัยและพัฒนา คาดว่าน่าจะเป็นตัวเดียวกับที่ใช้เป็นส่วนหนึ่งของระบบ Google Book Search ผมลองคอมไพล์แล้วรันเล่นดู เจ๋งดี ถ้าใช้ tesseract เฉย ๆ ผลลัพธ์จะเป็น plain text แต่ถ้าใช้ OCRopus tool chain มันได้มาเป็น HTML เลย (hOCR microformat) ซึ่งแปลว่าเราจะได้ layout และ style มาด้วย ตัวหนา ตัวเอียง มาหมด

แสกนเข้ามาแล้ว มันก็ต้องมีที่ผิดบ้างแหละ มากน้อยแล้วแต่ จะช่วยกันแก้ไขได้ยังไง ? ลองดูตัวแบบจากโครงการ Distribute Proofreaders (DP) (แนะนำโดย @thai101 ขอบคุณมาก ๆ ครับ) ซึ่งเป็นการเปิดให้อาสาสมัครบนอินเทอร์เน็ตมาช่วยกันพิสูจน์อักษร แก้ตัวสะกดผิด โดยโครงการนี้เจาะจงไปที่การแสกนหนังสือที่ไม่มีหรือพ้นการคุ้มครองลิขสิทธิ์ไปแล้ว (เป็นสมบัติสาธารณะหรืออยู่ใน Public Domain) พิสูจน์อักษร แล้วก็ส่งต่อหนังสือที่เสร็จสมบูรณ์แล้ว ให้กับ Project Gutenberg ต่อไป ตัวแบบของ DP นี้อาจจะเอามาปรับใช้กับโครงการอื่น ๆ ก็ได้

ทั้งหมดที่กล่าวนี้ จะเห็นว่าในส่วนของมาตรฐานก็เป็นมาตรฐานเปิด ส่วนซอฟต์แวร์ก็มีทางเลือกที่เป็นโอเพ่นซอร์ส แรงงานหรือก็มีคนยินดีร่วมเป็นอาสาสมัคร (ถ้าระบบมันไม่ใช้ยากเกินจนท้อไปเสียก่อน) อนาคตดูดีทีเดียว วงการห้องสมุด

งงกันมาพอสมควรแล้ว โพสต์นี้ไม่ได้ช่วยให้ใครเข้าใจอะไรขึ้นมาได้แน่ ผมเองก็ไม่เข้าใจ แต่มันพอจะทำให้เห็นความเชื่อมโยง อย่างน้อยก็ของตัวย่อมหาศาลที่จะบุกรุกเข้ามาในชีวิตคุณ ถ้าอยากจะเข้าไปสนุกในสนามห้องสมุดิจิทัล โปรดสังเกตว่าผมใช้คำว่า เข้าไป ไม่ใช่ เข้ามา เพราะผมเองก็ยังไม่ได้อยู่ในสนามนั้น :p ถ้าพัฒนาโปรแกรมอินเทอร์เน็ตได้ สนใจงานพวกนี้ อาจจะเฉี่ยวไปเฉี่ยวมาหน่อย ลองดู Jobs @Opendream

ถ้าอยากอ่านอีก โดดไป ProjectLib LibraryHub เลย หรือแจม LibCamp (ภาพงาน) ที่เดี๋ยวจะมีอีก ผมไม่รับผิดชอบแล้ว! มึน!

อยากมึนหนัก? เผ่นไปบล็อก iTeau โลด จริง ๆ ก็อาจจะไม่มึนนะ เขาเขียนอธิบายดีน่ะ ยกจอก :)

follow @projectlib @iteau @markpeak @kengggg และ @klaikong

อยากมีร้านสำหรับนั่งอ่านหนังสือ

technorati tags: , , , , , , ,

2007-06-20

International Press Telecommunication Council

International Press Telecommunication Council
IPTC focussed on developing and publishing Industry Standards for the interchange of news data.

IPTC News Exchange Formats (inc. NewsML), IPTC NewsCodes (taxonomies, controlled vocabularies), IPTC Photo Metadata

มาตรฐานแลกเปลี่ยนข้อมูลข่าว

technorati tags: , ,

2007-06-02

Listen (again)

หลังจากใช้ Exaile มาได้สักพัก ค่อนข้างพอใจ แต่ก็ยังมีปัญหากับไอพ็อดนิดหน่อย เล็ก ๆ น้อย ๆ และรู้สึกรำคาญเรื่องปกซีดีที่มันจัดการได้ไม่ค่อยดีนัก หาให้ไม่ค่อยเจอ ฯลฯ

ระหว่างไล่ดู Trac ของ Exaile, ข้อมูลเกี่ยวกับการเก็บภาพใน id3 tag ที่ id3.org, และ Mutagen (audio metadata library ภาษา Python โดยทีม Quod Libet) ก็ไปเจออีกโปรแกรมที่ชื่อ Listen ซึ่งดูแล้ว ก็คล้าย ๆ Exaile เลย น่าจะใช้โค้ด (ไลบารี) เหมือนกันหลายตัวด้วยซ้ำ .. เอ้า ลองหน่อย

การติดตั้งไม่ยุ่งยาก เพราะมีอยู่ใน repo ของ Ubuntu อยู่แล้ว ก็หาแพ็คเกจชื่อ “listen” ได้เลย

ตอนนี้ใช้อยู่ โอเคเลยนะ มีฟีเจอร์ที่ Exaile มีครบหมด (เช่น dynamic play list) แล้วก็ดูจะเก่งเรื่องหาปกซีดีกว่าด้วย

technorati tags: ,

2006-07-07

HOSxP - Free software Hospital Information System, with slick GUI. A solo project !

HOSxP (ไทย), emerged from a one-man-show project (the developer is a pharmacist by training), with NO public funding, now on a real use on over 70 hospitals across Thailand. Server runs on Linux or Windows, with client on Windows. Free as in speech and beer (GPL), the source code is on SourceForge. Check it out (and write a letter to your NIH or NHS).

read more | digg story

tags:

2006-04-25

your own "metadata" in mp3 Comments field

ทำไว้นานแล้ว เอามาเล่าตรงนี้ เผื่อว่าตอนโหลดเพลงในอนาคต เรา (ผม) จะได้ไม่ต้องมานั่งใส่เองแบบทุกวันนี้ :P

metadata ของเพลงในรายการของ Windows Media Player มีอยู่ตัวนึงที่ใน iTunes ไม่มี นั่นก็คือ ภาษาของเพลง (จริง ๆ ตรงนี้มันน่าจะเป็นส่วนของ ID3 Tag หรืออะไรที่คล้าย ๆ กัน ไม่น่าจะขึ้นอยู่กับตัวโปรแกรม เบื้องลึกจะเป็นอย่างไรไม่ได้ลงไปเจาะ แต่สรุปว่า iTunes มันไม่มีให้ใส่น่ะ)

บางครั้งผมก็อยากจะฟังแต่เพลงไทย ใน iTunes นี่ไม่รู้จะทำยังไงดี ก็เลยใช้วิธี ใส่ "metadata" ภาษาของเพลงลงไปเองในช่อง Comments

เช่นในช่อง Comments ของเพลง Ain't no sunshine ที่ Lighthouse Family ร้อง ผมใส่:

ost Notting Hill ; cover ; lang=en

หรือ อยากจะเข้าใจ ที่ Armchair ร้อง ผมใส่:

cover Crub ; lang=th

(ไทย th, อังกฤษ en, ญี่ปุ่น ja, เยอรมัน de, ฝรั่งเศส fr)

เวลาอยากจะฟังแต่เพลงไทย ผมก็สร้างรายการเพลงหล่อ (Smart Playlist) ขึ้นมาอันนึง
แล้วก็กำหนดเงื่อนไข comment contains "lang=th"

หรือถ้าอยากฟังแต่เพลงคัฟเวอร์ (ซึ่งผมมีความรู้สึกไปเองว่า เพลงไหนที่เอามาคัฟเวอร์ แปลว่ามันต้องเพราะสิ)
ก็กำหนด comment contains "cover"

อะไรทำนองนี้

จะว่าไป วิธีนี้มันก็ยังไม่สมบูรณ์ เพราะถ้าเกิดในช่อง comment มันดันเกิดมีคำที่เรากำหนด แต่จริง ๆ มันเป็นคนละความหมาย ยังไงมันก็จะเอามาใส่ในรายการเพลงให้อยู่ดี

จะให้รัดกุมขึ้นหน่อย ก็อาจจะใส่เป็น:

ost="Notting Hill" ; cover="" ; lang="en"
cover="Crub" ; lang="th"
live="Glastonbury" ; lang="en"

cover="" หมายถึง เป็นเพลงคัฟเวอร์นะ แต่คัฟเวอร์ใครมาไม่รู้
ถ้าไม่มี cover="xxx" เลย ก็แปลว่าไม่ได้เป็นคัฟเวอร์
เวลาจะหาเพลงคัฟเวอร์ทั้งหมด ไม่สนใจว่าจะคัฟเวอร์ใคร ก็ใช้ comment contains "cover="
แบบนี้โอกาสจะไปเจอรูปพ้องก็คงลดลง แต่ก็นะ มันก็ยุ่งยากมากขึ้น แล้วก็ดูไม่ค่อยเป็นมิตรซะเท่าไหร่ ต้องแลกกัน (แต่ก็ดีกว่าเอา XML มายัดลงในช่อง comment นิดนึง :P)

เป็นวิธีไถ ๆ ให้ใส่ metadata ที่เราต้องการลงไปในไฟล์ mp3 (หรือฟอร์แมตอื่น ๆ) ได้ โดยไม่ต้องไปง้อตัวโปรแกรม หรือรอมาตรฐานไฟล์รุ่นใหม่

ถ้าใครชอบใจ ก็ช่วย ๆ เอาวิธีนี้ไปใช้กันหน่อย ชีวิตผมจะได้มีคุณภาพมากขึ้น ฮ่ะฮ่ะ :P

ตะกี้เพิ่งไปอ่าน เออ แนวคิดคล้าย ๆ กันแฮะ เป็น key/value pair แต่ iTunes มันเล่น ogg บ่ล่ายอ่ะ

tags: , ,

2004-07-04

Metadata for the desktop

ใช้ RDF สำหรับ metadata บนเดสก์ทอป (i.e. ไม่ใช่เวบ)

2004-05-19

kowari : metastore

Kowari is an Open Source, massively scalable, transaction-safe, purpose-built database for the storage and retrieval of metadata. More information on Kowari, including its main features, can be found in the Kowari Overview.”

keywords: semantic web, Java, RDF, Atom, OWL, Atom OWL