Infrastructure for discovering geographically related linked data

2021 ◽  
Author(s):  
Βασίλειος Κοψαχείλης

Η διάθεση των κατάλληλων εργαλείων σε επαγγελματίες, επιστήμονες και άλλους γιατην υποστήριξη της αναζήτησης γεωγραφικών δεδομένων στον ιστό και την εφαρμογήπρακτικών ενσωμάτωσής τους είναι βασική προϋπόθεση για την ολοκλήρωση πολλών εργασιών, όπως η δημιουργία χαρτών και η χωρική ανάλυση. Νέοι τρόποι δημοσίευσηςσημασιολογικά εμπλουτισμένων δεδομένων στον ιστό, σύμφωνα με τις αρχές των συνδεδεμένων δεδομένων (Linked Data), έχουν οδηγήσει στη δημιουργία ενός μοναδικού,παγκόσμιου και διασυνδεδεμένου ιστού δεδομένων (Web of Data), ο οποίος διευκολύνειτην πρόσβαση, επεξεργασία και ενσωμάτωση μεγάλων ποσοτήτων δεδομένων από διαφορετικές πηγές και παρέχει προηγμένες δυνατότητες αναζήτησης και επερωτήσεων. Σε αυτήν την έρευνα, διερευνούμε το πρόβλημα της εύρεσης σχετιζόμενων γεωγραφικών δεδομένων στον ιστό δεδομένων. Συγκεκριμένα, προτείνουμε μία μεθοδολογία αναζήτησηςσυνόλων δεδομένων για την ανακάλυψη συνδέσμων (dataset recommendation for linkdiscovery), η οποία προτείνει, σε ένα δοσμένο σύνολο δεδομένων, άλλα σύνολα δεδομένων του ιστού δεδομένων που ενδέχεται να περιέχουν σχετικές οντότητες, δηλαδήοντότητες που περιγράφουν σημασιολογικά κοντινά ή ίδια γεωγραφικά αντικείμενα τουπραγματικού κόσμου. Τα προτεινόμενα σύνολα δεδομένων μπορούν εκ των υστέρωννα χρησιμοποιηθούν ως είσοδος σε μία διαδικασία ανακάλυψης συνδέσμων (link discovery) για τη δημιουργία των συνδέσμων (π.χ. sameAs) μεταξύ των σχετικών οντοτήτων.Σε αντίθεση με τις υφιστάμενες μεθοδολογίες, οι οποίες προτείνουν σχετικά σύνολαδεδομένων με βάση την ομοιότητα των αλφαριθμητικών και της δομής τους ή την αξιοποίηση υφιστάμενων συνδέσμων μεταξύ τους, προσεγγίζουμε το πρόβλημα από μίαγεωγραφική οπτική, θεμελιώνοντας την υπόθεση ότι ‘σύνολα δεδομένων των οποίων οιοντότητες παρουσιάζουν παρόμοια χωρική κατανομή είναι πιθανό να περιέχουν σημασιολογικά σχετιζόμενες οντότητες’. Για να υποστηρίξουμε την υπόθεσή μας, υλοποιήσαμεμία πρακτική λύση, η οποία έχει εφαρμογή σε κλίμακα διαδικτύου και αρχικά δημιουργείσυνόψεις σε γεωγραφικά χαρακτηριστικά (σημειακές οντότητες) των χωρικών συνόλωνδεδομένων που παρέχονται μέσω SPARQL endpoints και στη συνέχεια εφαρμόζει μετρικέςγια τον υπολογισμό της ομοιότητάς τους. Οι συνόψεις αποτυπώνουν γεωγραφικά χαρακτηριστικά των συνόλων δεδομένων, όπως η χωρική τους έκταση και η χωρική κατανομήτων οντοτήτων τους. Διάφορες μετρικές που βασίζονται στην ομοιότητα συνόλων, στηστατιστική και στη θεωρία πληροφορίας, εφαρμόζονται στις συνόψεις των συνόλων δεδομένων για τον υπολογισμό ενός βαθμού γεωγραφικής ομοιότητας συνόλων δεδομένων.΄Ενας αλγόριθμος αναζήτησης ταξινομεί τα προτεινόμενα σύνολα δεδομένων σύμφωνα μετη γεωγραφική τους ομοιότητα, έτσι ώστε στην κορυφή της ταξινομημένης λίστας ναβρίσκονται τα σύνολα δεδομένων που είναι πιο πιθανό να περιέχουν σχετικές οντότητες με το επερωτώμενο αρχικό σύνολο δεδομένων. Διεξαγάγαμε πειράματα για την αξιολόγηση της αποτελεσματικότητας και αποδοτικότητας της μεθοδολογίας αναζήτησηςσυνόλων δεδομένων για την ανακάλυψη συνδέσμων. Σύμφωνα με τα αποτελέσματατων πειραμάτων, ο προτεινόμενος αλγόριθμος αναζήτησης παράγει ταξινομημένες λίστεςσυνόλων δεδομένων με 62% μέση ακρίβεια (Mean Average Precision), περίπου 35% υψηλότερης σε σύγκριση με απλούς εναλλακτικούς αλγόριθμους. Επίσης, μειώνει περίπουκατά 99% τον χώρο αναζήτησης για σχετικά σύνολα δεδομένων στον ιστό δεδομένων μετη χρήση αποδοτικών τεχνικών. Μία πρόσθετη συνεισφορά της εργασίας μας αφορά τηνανάπτυξη μεθόδων που παρέχουν ενιαία πρόσβαση στο σύνολο του ιστού δεδομένων καιτην παραγωγή αναφορών σχετικά με το μέγεθος και την κατάσταση του γεωγραφικούσημασιολογικού ιστού (Semantic Web) που δείχνουν ότι περίπου το 39% των συνόλωνδεδομένων του σημασιολογικού ιστού περιέχουν γεωαναφερμένη πληροφορία. Επιπλέον,προτείνουμε το GeoVoID, ένα πρότυπο μεταδεδομένων για την περιγραφή γεωγραφικώνχαρακτηριστικών των συνόλων δεδομένων όπως η χωρική τους έκταση, οι χωρικές οντολογίες που χρησιμοποιούνται και ο αριθμός των γεωγραφικών τους οντοτήτων. Το αποτέλεσμα της έρευνάς μας πραγματώνεται σε μία διαδικτυακή εφαρμογή που ονομάζεται GeoLOD και αποτελεί έναν ενδελεχή κατάλογο χωρικών συνόλων δεδομένων στον σημασιολογικό ιστό και μία online μηχανή αναζήτησης συνόλων δεδομένων για την ανακάλυψησυνδέσμων. Η GeoLOD επιτρέπει την αναζήτηση συνόλων δεδομένων μέσω χάρτη καιπαρέχει καινοτόμες λειτουργίες όπως η ζωντανή προεπισκόπηση των περιεχομένων τωνσυνόλων δεδομένων σε διαδραστικό χάρτη, η εξαγωγή αρχείων ρυθμίσεων για άμεσηχρήση από τα λογισμικά ανακάλυψης συνδέσμων Silk και LIMES και η on-the-fly πρόταση συνόλων δεδομένων για την ανακάλυψη συνδέσμων για σύνολα δεδομένων πουπαρέχονται από άγνωστα SPARQL endpoints και σε συμβατή με τα Γεωγραφικά Πληροφοριακά Συστήματα (ΓΠΣ) μορφή (π.χ. Shapefile). Η χρησιμότητα της GeoLOD για τουςεπαγγελματίες ΓΠΣ και τους ειδικούς σε θέματα συνδεδεμένων δεδομένων επιβεβαιώνεται από τα αποτελέσματα μίας διεξαχθείσας μελέτης χρηστών.

Author(s):  
Georg Neubauer

The main subject of the work is the visualization of typed links in Linked Data. The academic subjects relevant to the paper in general are the Semantic Web, the Web of Data and information visualization. The Semantic Web, invented by Tim Berners-Lee in 2001, was announced as an extension to the World Wide Web (Web 2.0). The actual area of investigation concerns the connectivity of information on the World Wide Web. To be able to explore such interconnections, visualizations are critical requirements as well as a major part of processing data in themselves. In the context of the Semantic Web, representation of information interrelations can be achieved using graphs. The aim of the article is to primarily describe the arrangement of Linked Data visualization concepts by establishing their principles in a theoretical approach. Putting design restrictions into context leads to practical guidelines. By describing the creation of two alternative visualizations of a commonly used web application representing Linked Data as network visualization, their compatibility was tested. The application-oriented part treats the design phase, its results, and future requirements of the project that can be derived from this test.


Author(s):  
Leila Zemmouchi-Ghomari

Data play a central role in the effectiveness and efficiency of web applications, such as the Semantic Web. However, data are distributed across a very large number of online sources, due to which a significant effort is needed to integrate this data for its proper utilization. A promising solution to this issue is the linked data initiative, which is based on four principles related to publishing web data and facilitating interlinked and structured online data rather than the existing web of documents. The basic ideas, techniques, and applications of the linked data initiative are surveyed in this paper. The authors discuss some Linked Data open issues and potential tracks to address these pending questions.


Author(s):  
Amrapali Zaveri ◽  
Andrea Maurino ◽  
Laure-Berti Equille

The standardization and adoption of Semantic Web technologies has resulted in an unprecedented volume of data being published as Linked Data (LD). However, the “publish first, refine later” philosophy leads to various quality problems arising in the underlying data such as incompleteness, inconsistency and semantic ambiguities. In this article, we describe the current state of Data Quality in the Web of Data along with details of the three papers accepted for the International Journal on Semantic Web and Information Systems' (IJSWIS) Special Issue on Web Data Quality. Additionally, we identify new challenges that are specific to the Web of Data and provide insights into the current progress and future directions for each of those challenges.


Author(s):  
Alfio Ferrara ◽  
Andriy Nikolov ◽  
François Scharffe

By specifying that published datasets must link to other existing datasets, the 4th linked data principle ensures a Web of data and not just a set of unconnected data islands. The authors propose in this paper the term data linking to name the problem of finding equivalent resources on the Web of linked data. In order to perform data linking, many techniques were developed, finding their roots in statistics, database, natural language processing and graph theory. The authors begin this paper by providing background information and terminological clarifications related to data linking. Then a comprehensive survey over the various techniques available for data linking is provided. These techniques are classified along the three criteria of granularity, type of evidence, and source of the evidence. Finally, the authors survey eleven recent tools performing data linking and we classify them according to the surveyed techniques.


2021 ◽  
Vol 5 (2) ◽  
pp. 17
Author(s):  
Vasilis Kopsachilis ◽  
Michail Vaitis

The increasing availability of linked data poses new challenges for the identification and retrieval of the most appropriate data sources that meet user needs. Recent dataset catalogs and recommenders provide advanced methods that facilitate linked data search, but none exploits the spatial characteristics of datasets. In this paper, we present GeoLOD, a web catalog of spatial datasets and classes and a recommender for spatial datasets and classes possibly relevant for link discovery processes. GeoLOD Catalog parses, maintains and generates metadata about datasets and classes provided by SPARQL endpoints that contain georeferenced point instances. It offers text and map-based search functionality and dataset descriptions in GeoVoID, a spatial dataset metadata template that extends VoID. GeoLOD Recommender pre-computes and maintains, for all identified spatial classes in the Web of Data (WoD), ranked lists of classes relevant for link discovery. In addition, the on-the-fly Recommender allows users to define an uncatalogued SPARQL endpoint, a GeoJSON or a Shapefile and get class recommendations in real time. Furthermore, generated recommendations can be automatically exported in SILK and LIMES configuration files in order to be used for a link discovery task. In the results, we provide statistics about the status and potential connectivity of spatial datasets in the WoD, we assess the applicability of the recommender, and we present the outcome of a system usability study. GeoLOD is the first catalog that targets both linked data experts and geographic information systems professionals, exploits geographical characteristics of datasets and provides an exhaustive list of WoD spatial datasets and classes along with class recommendations for link discovery.


Semantic Web ◽  
2013 ◽  
pp. 169-200 ◽  
Author(s):  
Alfio Ferraram ◽  
Andriy Nikolov ◽  
François Scharffe

By specifying that published datasets must link to other existing datasets, the 4th linked data principle ensures a Web of data and not just a set of unconnected data islands. The authors propose in this paper the term data linking to name the problem of finding equivalent resources on the Web of linked data. In order to perform data linking, many techniques were developed, finding their roots in statistics, database, natural language processing and graph theory. The authors begin this paper by providing background information and terminological clarifications related to data linking. Then a comprehensive survey over the various techniques available for data linking is provided. These techniques are classified along the three criteria of granularity, type of evidence, and source of the evidence. Finally, the authors survey eleven recent tools performing data linking and we classify them according to the surveyed techniques.


2019 ◽  
Vol 13 (1) ◽  
pp. 57-74
Author(s):  
Jhon Francined Herrera-Cubides ◽  
Paulo Alonso Gaona-García ◽  
Carlos Enrique Montenegro-Marín ◽  
Salvador Sánchez-Alonso ◽  
David Martin-Moncunill

Linked Data, as a strategy of the Semantic Web, is based on application of some basic principles that contribute to the growth of the Web, thus allowing the transit of the Web of Documents to the Web of Data. Developed process by Linked Data is supported in different scenarios, which interact in order to carry out the linking of resources on the Web. Some of these scenarios present a solid technological background, while others propose challenges when they are implemented. This paper aims to identify and expose a generic abstraction of Linked Data, in order to identify problem situations that restrict Linked Data process.


Author(s):  
D. Ulutaş Karakol ◽  
G. Kara ◽  
C. Yılmaz ◽  
Ç. Cömert

<p><strong>Abstract.</strong> Large amounts of spatial data are hold in relational databases. Spatial data in the relational databases must be converted to RDF for semantic web applications. Spatial data is an important key factor for creating spatial RDF data. Linked Data is the most preferred way by users to publish and share data in the relational databases on the Web. In order to define the semantics of the data, links are provided to vocabularies (ontologies or other external web resources) that are common conceptualizations for a domain. Linking data of resource vocabulary with globally published concepts of domain resources combines different data sources and datasets, makes data more understandable, discoverable and usable, improves data interoperability and integration, provides automatic reasoning and prevents data duplication. The need to convert relational data to RDF is coming in sight due to semantic expressiveness of Semantic Web Technologies. One of the important key factors of Semantic Web is ontologies. Ontology means “explicit specification of a conceptualization”. The semantics of spatial data relies on ontologies. Linking of spatial data from relational databases to the web data sources is not an easy task for sharing machine-readable interlinked data on the Web. Tim Berners-Lee, the inventor of the World Wide Web and the advocate of Semantic Web and Linked Data, layed down the Linked Data design principles. Based on these rules, firstly, spatial data in the relational databases must be converted to RDF with the use of supporting tools. Secondly, spatial RDF data must be linked to upper level-domain ontologies and related web data sources. Thirdly, external data sources (ontologies and web data sources) must be determined and spatial RDF data must be linked related data sources. Finally, spatial linked data must be published on the web. The main contribution of this study is to determine requirements for finding RDF links and put forward the deficiencies for creating or publishing linked spatial data. To achieve this objective, this study researches existing approaches, conversion tools and web data sources for relational data conversion to the spatial RDF. In this paper, we have investigated current state of spatial RDF data, standards, open source platforms (particularly D2RQ, Geometry2RDF, TripleGeo, GeoTriples, Ontop, etc.) and the Web Data Sources. Moreover, the process of spatial data conversion to the RDF and how to link it to the web data sources is described. The implementation of linking spatial RDF data to the web data sources is demonstrated with an example use case. Road data has been linked to the one of the related popular web data sources, DBPedia. SILK, a tool for discovering relationships between data items within different Linked Data sources, is used as a link discovery framework. Also, we evaluated other link discovery tools e.g. LIMES, Silk and results are compared to carry out matching/linking task. As a result, linked road data is shared and represented as an information resource on the web and enriched with definitions of related different resources. By this way, road datasets are also linked by the related classes, individuals, spatial relations and properties they cover such as, construction date, road length, coordinates, etc.</p>


2021 ◽  
Author(s):  
Gillian Byrne ◽  
Lisa Goddard

Since 1999 the W3C has been working on a set of Semantic Web standards that have the potential to revolutionize web search. Also known as Linked Data, the Machine‐Readable Web, the Web of Data, or Web3.0, the Semantic Web relies on highly structured metadata that allow computers to understand the relationships between objects. Semantic web standards are complex, and difficult to conceptualize, but they offer solutions to many of the issues that plague libraries, including precise web search, authority control, classification, data portability, and disambiguation. This article will outline some of the benefits that linked data could have for libraries, will discuss some of the non‐technical obstacles that we face in moving forward, and will finally offer suggestions for practical ways in which libraries can participate in the development of the semantic web.


Sign in / Sign up

Export Citation Format

Share Document