Posts mit dem Label statistique werden angezeigt. Alle Posts anzeigen
Posts mit dem Label statistique werden angezeigt. Alle Posts anzeigen

Sonntag, 19. Juli 2020

A Machine Learning Approach with Ensemble Methods for Deduplication of Swissbib Data

The notion of Machine Learning includes a wide group of statistical algorithms where a computer system learns on a set of training data and, after having completed its learning phase, uses its experience to generate predictions on new, unknown data. In the context of the capstone project of an advanced online training course at EPF Lausanne, a swissbib admirer takes the challenge to do Machine Learning with a set of library catalogue data in MARC 21 format. The goal of the project is to build an artificial machine being capable to find duplicate records in the data. The project is done with three distinct groups of models. In this blog, the results of a Decision Tree and a Random Forests model are presented.

The starting point for Machine Learning is data. The data generally consists of two distinct types of variables, features and its target. The variables of the data set that serve as input for computing the prediction are called features. The features of the data are constructed with the help of two records of original swissbib data containing raw information of a bibliographic unit, each. Such two records of raw data are paired in each of its attributes, calculating a numerical similarity distance for each pair of same attributes of the two bibliographical records, see figure 1. For example, for two arbitrary records, the mathematical distance between title1 (title of record r1) and title2 (title of record r2) are determined to be the feature titleΔ = sim(title1,title2), where sim(x1,x2) is a mathematical similarity function. For the project at hand, twenty distinct similarities of two times twenty raw data attributes like title, author, year, ISBN, ISMN, etc. are calculated for each feature record. Therefore, the number of features are twenty. A feature record is represented as an array in the memory of a computer system. All rows of feature arrays can be represented in the form of a matrix. Therefore, the full set of this data is called feature matrix. The total of feature records used for training the data is nearly 260'000.
Figure 1: Records pairing
Figure 1: Records pairing
The variable of a data set that is to be predicted by the machine is called output or target, see figure 2. Each feature record has its target value. For each feature record of the project described above, the target variable indicates whether a data row of features is either a row of unique records or a row of duplicate records. The possible target values are 0 (row of unique records) or 1 (row of duplicate records), resp. A more detailed description on how to calculate the feature matrix and its array of target values for the training data will be given in a later blog to come.
Figure 2: Feature matrix, machine and target
Figure 2: Feature matrix, machine and target
The idea behind a Decision Tree algorithm is that the computer system learns a set of sequential if-then-else rules that lead to a final decision. Each if-then-else statement is called a node of the Decision Tree. The nodes are arranged in sequences to form of a binary tree, see figure 3, which is the reason for its naming. In the swissbib project, the set of if-then-else rules is a sequence of thresholds for binary statements of one feature variable that can either be lower or higher than the specific threshold. To classify a feature record, the algorithm starts at the top of the tree and evaluates the statement in each node on its path down. Depending on the threshold value, the algorithm decides for the right-lower or the left-lower node as the next node until reaching the bottom of the tree. The final decision is called a leaf of the Decision Tree. The leaf concludes the decision wether the feature record is a pair of uniques or a pair of duplicates. During training a Decision Tree, the if-then-else rules of the nodes are adjusted iteratively until the Decision Tree predicts the target value of the training data feature rows with the highest possible probability according to a function to measure the quality of decisions, called criterion. When this highest power of prediction on the training data is reached, the Decision Tree can be used for predicting new, unseen data.
Figure 3: Graphical representation of the Decision Tree on swissbib data
Figure 3: Graphical representation of the Decision Tree on swissbib data
Decision Tree is a classical method of Machine Learning. Its advantage is its clarity. It can be easily interpreted when looking at the trained model tree. A Decision Tree classifier can be built with the help of different parameters. In the project, the varied parameters are the maximum depth of the tree as well as the so called criterion, the mathematical function to measure the quality of a split in the nodes. Several specific Decision Trees are calculated with the help of cross-validation and their prediction power is compared. The project finds the best Decision Tree for swissbib data to have a maximum depth of 26 nodes and a criterion of Gini impurity.

The performance of a Machine Learning classifier can be measured with the help of some metrics derived from the confusion matrix, see figure 4. The confusion matrix compares the predictions of a trained machine on some validation data with their given target values. Four cases can be distinguished.
  • Two "true" cases (1. "true positive" and 2. "true negative") according to the two specific classes are the correctly predicted records of the validation data.
  • Two "false" cases (3. "false positive" and 4. "false negative") according to the two specific classes are the wrongly predicted records of the validation data.
Figure 4: Confusion matrix
Figure 4: Confusion matrix
From the four cases above, a metrics called accuracy can be calculated, allowing a statement on the prediction quality of the model on unknown data. For swissbib's calculated Decision Tree, an accuracy value of nearly 99.95% can be reached. This accuracy means 27 wrongly predicted records on a total of 51'886 validation records.

For comparison reasons, a Random Forests model is calculated additionally. A Random Forests is an Ensemble method. It consists of an ensemble of Decision Trees that are assembled during the learning phase. Again, the set of best parameters for the Random Forests is searched for swissbib data and a number of 100 trees of maximum depth of 22 each in the forest is found to generate the best results. With Random Forests, an accuracy of nearly 99.95% can be reached, too, with the same total of wrongly predicted records of 27 on the total of the validation records.

The project is implemented in programming language Python, using library scikit-learn for calculating the models. The Random Forests implementation of this library allows for assessing the importance of each feature for prediction. Figure 5 shows the normed importance value of the features used. It can be seen that variable year is the leading variable for indicating wether a pair of records is a pair of uniques or of duplicates. Variable title is the second most important feature for the Random Forests model, but also author and volumes indication are of high relevance. The importance of features like coordinate and ISMN seem to be low. This is due to the fact that only few of swissbib's raw data are of format map of music. Therefore, only few of swissbib's raw data hold any information in these attributes.
Figure 5: Normed feature importance of Random Forests
Figure 5: Normed feature importance of Random Forests
The results presented here, suggest swissbib to implement a new deduplication process with the help of a Random Forests algorithm, due its best overall performance on the training data. The project described here, implements some more models different to the Decision Tree and the Random Forests models. The results of those will be presented in some additional blog articles (see here).

Donnerstag, 12. Juli 2018

Eure Feedbacks aus der Nutzerumfrage 2017 / Vos commentaires suite au sondage 2017 auprès des utilisateurs

Deutsche Version Version française

Entwurf der Umfrage vom September 2017
Entwurf der Umfrage vom September 2017
Von November bis Dezember 2017 haben wir unsere User gefragt, was sie von swissbib, dem Katalog und seinen Funktionalitäten halten und was wir besser machen könnten. In einem Blogbeitrag im April haben wir die ersten Zahlen bereits veröffentlicht. In den 1087 ausgefüllten Umfrageformularen fanden sich aber auch nicht wenige Freitext-Kommentare, die für uns von besonderem Wert sind (genauer gesagt: in 42% der Formulare). Wir versuchten diese zu gruppieren und die Kernaussagen zusammenzufassen:
  • Darstellung: 150 Aussagen zu dubletten Einträgen, zu Such-, Filter- und Ausleihfunktionalitäten und zur Einbindung von Inhaltsverzeichnissen und Mediencovers
  • Aus- und Fernleihe: 56 Aussagen zum Ausleihvorgang und zu den Benutzerkonten
  • Suche und Filtermöglichkeiten: 111 Aussagen zu Facetten und Filtern, zu Autokorrektur, einfacher und erweiterter Suche
  • Dienstleistungen allgemein: 51 Aussagen zur Ausleihe, zu Merklisten, Datenexporten und zur Integration von Katalogen und Bibliotheken
  • E-Medien: 43 Aussagen zur Darstellung, Zugänglichkeit und «Ausleihe» von elektronischen Medien (E-Books und E-Journals)

Des Weiteren erhielten wir 19 Aussagen zur Darstellung von Reihen und Zeitschriften sowie 109 Aussagen allgemeiner Art. Mehrmals wurde zudem moniert, dass jusbib zuwenig spezifisch abgefragt wurde. Dafür erhielten wir mehrere Freitext-Kommentare zu dieser Rechercheoberfläche, vor allem aus der französischen Schweiz.

In einem nächsten Schritt haben wir die meistvertretenen Wünsche und Hinweise eruiert und unsere diesbezüglichen Möglichkeiten bewertet.

Darstellung

Sehr oft wurden die zu vielen dubletten Einträge kritisiert. Das ist ein bekanntes Problem für uns, das wir in der kommenden Zeit angehen möchten, zumal wir voraussichtlich für SLSP den Auftrag zur Dedublierung des bibliografischen Datenbestandes zwecks Überführung in Ex Libris Alma übernehmen werden. Hier sehen unsere Datenexperten auch ein grosses Potenzial mittels Clusterbildung (Stichwort FRBR) und Verbesserung der Merges.

Auch die heutzutage stärkere visuelle Wahrnehmung zeigte sich in den Kommentaren: mehr Inhaltsverzeichnisse und mehr Mediencovers werden gewünscht. Hier sind unsere Möglichkeiten jedoch beschränkt. Inhaltsverzeichnisse spielen wir nicht selbst ein, sondern übernehmen sie von den Bibliotheksverbünden, die sie uns in ihren Daten mitliefern. Die Einspielung von mehr Mediencovers wäre durchaus möglich, allerdings stossen wir mengenmässig an die Grenzen dessen, was mit unseren heutigen Methoden kostenlos machbar ist. Es existieren zwar Services, die Covers gegen Gebühr liefern, allerdings möchten wir unsere begrenzten Mittel vorerst lieber für andere Aufgaben einsetzen.

Aus- und Fernleihe

Unsere User stören sich vor allem an zu langen Wegen. Von der Eingabe der Suche bis zur Bestellung eines Mediums sind zu viele Klicks nötig. Auch die Weiterleitung auf externe Kataloge für die Bestellung trägt hierzu bei. Die vergleichsweise hohe Anzahl Klicks sind uns zwar bewusst, allerdings versuchen wir die Balance zwischen Übersichtlichkeit an Information und Menge an Klicks zu wahren. Einen grossen Anteil an dieser Kette nimmt die Weiterleitung an externe Kataloge. Das ist aber tatsächlich ein Entscheid auf politischer Ebene, an den wir gebunden sind.

Angemerkt wurde auch, dass die Möglichkeiten des Kopien- und Medienversandes (Stichwort: Fernleihe) zu wenig klar sind. Zu diesem Punkt wären wir sehr froh über Vorschläge zur Verbesserung. Kommentare zu diesem Blogartikel sind also ausdrücklich willkommen!

Suche und Filtermöglichkeiten

Die zentrale Funktion von swissbib ist die Recherche. Entsprechend kamen hier auch viele Wünsche, die den Komfort und die Übersichtlichkeit betreffen. Autoritätsdaten von Personen, Körperschaften und Themen sollen besser eingebunden und allgemein die Qualität der Suche verbessert werden (bspw. durch Autokorrektur der Sucheingabe, gerade bei Tippfehlern). Ersteres haben wir teilweise mit dem Update im März bereits umgesetzt. Für ca. 200'000 Personen und 300'000 Themen haben wir sogenannte Knowledge-Cards eingespielt, die unter anderem die (biografischen und thematischen) Informationen aus den Autoritätsdatensätzen sichtbar machen (Datenquellen sind hierfür die GND, VIAF und DBpedia). Mehr Knowledge-Cards sind zwar gewünscht, allerdings gehen wir vorerst nach dem Motto «lieber richtig als viel» vor, um keine Falscheinträge zu erzeugen. Die Suchqualität insgesamt versuchen wir konstant zu verbessern, bspw. durch Software-Updates (insb. von Solr).

Als neue Funktion wurde gewünscht, dass ein zusätzlicher Filter eingebaut werden soll, um die bestellbaren Medien hervorheben zu können (also ein optionaler Ausschluss aller Medien, die entweder bereits ausgeliehen, oder nur vor Ort konsultierbar sind). In der aktuellen Architektur würden dabei jedoch die Bibliothekssysteme der Datenlieferanten (sprich: der Bibliotheken und Archive) in die Knie gehen. Ebenso wurde gewünscht, dass die Facette «Bibliothek» nicht nach Verbünden, sondern nach einzelnen Institutionen aufgebaut sein sollte (analog zu swissbib Basel Bern). Was in swissbib Basel Bern durch die überschaubare Anzahl an Institutionen gut machbar ist, ist in swissbib mit über 960 Institutionen bereits schwieriger bzw. das Ergebnis tendenziell unübersichtlicher. Daher müsste zumindest eine aufklappbare Facette nach Region, Kanton oder Bibliotheksverbund realisiert werden. Dies ist mit einem gewissen Aufwand verbunden, wir behalten diesen Wunsch jedoch im Hinterkopf.

Dienstleistungen allgemein

Die gewichtigsten Anmerkungen betrafen die Merklisten, die wahlweise, je nach User, öffentlich, teilbar oder als ganzes bestellbar sein sollen. Letzteres ist technisch schwierig machbar, da für eine Bestellung ein Exemplar ausgewählt, der Exemplarstatus geprüft und die Bestellung in einem externen Katalog ausgeführt werden muss. Und das je nach Fall für mehrere Dutzend Merklisteneinträge gleichzeitig. Öffentlichkeit und Teilbarkeit sind aus unserer Sicht machbare Anliegen. Wir haben jedoch das Gefühl, dass es dafür bereits swissbib-externe Dienste gibt, die sich dafür besser eignen dürften (bspw. Pocket). Die Integration von weiteren Datenquellen bleibt natürlich ein Thema, wenngleich wir bereits über 960 Institutionen in swissbib eingebunden haben. Mehrere User haben sogar konkrete Wünsche genannt, welche Institutionen zusätzlich eingebunden werden sollten. Auch im Alltag erhalten wir regelmässig Anfragen von Interessierten. Aktuell sind wir bei der Integration neuer Quellen jedoch zurückhaltend. Es ist vorgesehen, dass ab 2021 die Suchoberfläche Primo von SLSP in irgendeiner Form die Funktion eines nationalen Metakatalogs für die Schweiz von swissbib übernehmen wird. Wie das genau aussehen soll und wie nicht-wissenschaftliche Institutionen (also bspw. öffentliche und Schul-Bibliotheken) darin integriert werden sollen, ist aktuell noch unklar. Wir sind allerdings dabei, diese Frage mit SLSP zu klären und hoffen, bis zum Frühling 2019 eine eindeutige Vorstellung zu haben. Bis dahin halten wir es aus Gründen der Fairness und Transparenz für sinnvoller, die Integration weiterer Datenquellen vorerst aufzuschieben, um Interessierten eine genaue Vision ihrer Zukunft in swissbib ab 2021 skizzieren zu können.

E-Medien

Die Wünsche zu den elektronischen Medien lassen sich auf zwei Worte zusammenfassen: besserer Zugang. Es soll sichtbarer sein, wo E-Medien vorhanden sind (am besten schon in der Ergebnisliste). Dafür prüfen wir verschiedene Möglichkeiten, haben aber aktuell noch keinen konkreten Umsetzungsvorschlag vor Augen.

Fazit

konstruktiv waren, teilweise Lob (oder das Gegenteil) enthielten und uns manchmal auch zum Schmunzeln brachten («Ein Kaffeeautomat am Eingang (grins)»). Einige Kommentare gaben uns auch wertvolle Hinweise auf mögliche Bugs, die wir auf jeden Fall angehen werden. Die obligatorische App wurde ebenfalls gewünscht, was wir aber leider abschlägig beantworten müssen.

Um alle Wünsche angehen zu können, fehlen uns leider die Ressourcen (für das breite Portfolio von swissbib, das nicht nur aus den Oberflächen swissbib und swissbib Basel Bern besteht, setzen die verfügbaren rund 3 Vollzeitstellen auch unseren eigenen Ideen immer wieder Grenzen). Die meistgenannten und vor allem störendsten Faktoren werden wir aber auf jeden Fall anzugehen versuchen.

Als P.S. möchten wir noch eine Information anbringen, die tatsächlich nicht allen unseren Nutzern bekannt zu sein scheint: swissbib und die swiss-lib-Mailingliste haben nichts miteinander zu tun. Während ersteres eine Dienstleistung der Universitätsbibliothek Basel ist (bis Mitte dieses Jahres finanziert durch das Programm P-5 von swissuniversities), ist letzteres die schweizerische Mailingliste der SpezialistInnen für Information und Dokumentation, betrieben durch die HES-SO Genève und SWITCH.

Freitag, 6. April 2018

Kurzbericht zur Nutzerumfrage 2017 / Résumé de notre sondage 2017 auprès des utilisateurs

Deutsche Version Version française

Quick Facts

  • Die Umfrage war während 48 Tagen aufgeschaltet (vom 6.11.2017 bis zum 24.12.2017)
  • Die Umfrage wurde 1254 Mal aufgerufen und 1087 Mal vollständig ausgefüllt
  • An der Umfrage nahmen 569 Bibliothekar_innen, 199 Personen aus Lehre und Forschung, 197 Studierende, 96 Andere, 26 Personen ohne persönlichen Angaben teil
  • 42% der Umfrageteilnehmer_innen haben im Freitextfeld ihr Feedback zu swissbib gegeben
  • 780 Antworten wurden auf Deutsch, 240 auf Französisch, 46 auf Englisch und 21 Antworten auf Italienisch gegeben
  • Rund 93% aller Benutzenden sind zufrieden mit swissbib

Wie zufrieden sind die Benutzer_innen mit swissbib und woher kommen sie?


Generelle Zufriedenheit der Nutzer_innen mit swissbib
Illustration 1: Generelle Zufriedenheit der Nutzer_innen mit swissbib

Zufriedenheit der Nutzer_innen mit swissbib nach Nutzergruppen
Illustration 2: Zufriedenheit der Nutzer_innen mit swissbib nach Nutzergruppen

Geografisch gaben die meisten Teilnehmer_innen ihren Arbeits- oder Studienort mit Bern (260 Antworten), Zürich (209 Antworten), Basel (97 Antworten) oder Genf (82 Antworten) an. Durchwegs sind Bibliotheksmitarbeitende am stärksten vertreten, insbesondere in Zürich (124 von 209 Antworten) und Genf (63 von 82 Antworten), während in Bern und Basel auch Studierende und Personen aus Lehre und Forschung rege teilgenommen hatten.

Interessant ist die Aufschlüsselung der Zufriedenheit nach «Berufsgruppen». Von den Bibliotheksmitarbeitenden sind nur gerade 7 % aller Teilnehmenden unzufrieden oder sehr unzufrieden. Personen aus Lehre und Forschung sind mit insgesamt 10 % am unzufriedensten (wobei die Unzufriedenheit bei solch tiefen Werten eher relativ ist), die Studierenden mit nur gerade 5 % sind am wenigsten unzufrieden.

Wie oft verwenden die Benutzer_innen swissbib und in welcher Form?


Häufigkeit der Verwendung von swissbib als Suchinstrument
Illustration 3: Häufigkeit der Verwendung von swissbib als Suchinstrument

Die Nutzung von swissbib zeigt sich vor allem in täglicher oder wöchentlicher Frequenz. Interessant ist der Vergleich mit den Angaben zur häufigsten Katalognutzung. Hierbei haben wir eine Liste möglicher Kataloge (swissbib, aber auch RERO, NEBIS, Helveticat, ETH-Wissensportal, Alexandria oder Google Scholar) angegeben, bei der ein Eintrag ausgewählt werden konnte. 9 Personen haben im Freitext-Feld zudem angegeben, dass sie bevorzugt die View jusbib von swissbib benutzen.

  1. swissbib (grün): 394 Nennungen
  2. swissbib Basel Bern (orange): 221 Nennungen
  3. RERO: 129 Nennungen
  4. NEBIS: 122 Nennungen
  5. Andere: 91 Nennungen
  6. Rechercheportal Zürich: 53 Nennungen
  7. ILUplus: 22 Nennungen
  8. Helveticat: 13 Nennungen
  9. HSG-Recherche: 12 Nennungen
  10. ETH-Wissensportal: 11 Nennungen
  11. Alexandria: 8 Nennungen
  12. Google Scholar: 6 Nennungen
  13. Catalogo sbt: 4 Nennungen

Wir haben auch gefragt, wann swissbib genutzt wird. Der Schweizer Metakatalog ist ein gesuchtes Produkt: 38 % der Teilnehmenden nutzen swissbib als Erst-Suchsystem, immerhin weitere 37 % wechseln zu swissbib, wenn sie in ihrem lokalen Bibliothekssystem nichts gefunden haben.

Ab wann wird swissbib als Suchinstrument eingesetzt?
Illustration 4: Wann wird swissbib als Suchinstrument eingesetzt?

Fazit

Positiv überrascht hat uns die durchwegs hohe Zufriedenheit der Teilnehmenden mit swissbib. Natürlich sind wir persönlich Fans unseres Produkts. Dass sich diese Zufriedenheit in diesem Ausmass auch auf unsere Benutzer_innen überträgt, freut uns ausserordentlich und dafür bedanken wir uns herzlich.

Die hohe Beteiligung der Bibliotheksmitarbeitenden dürfte primär den Publikationswegen der Umfrage geschuldet sein. Die Zugriffswege konnten in 721 Fällen eindeutig festgestellt werden, wobei die Mehrheit via swissbib-Webseite (631 Fälle) kam, einige aber auch über den swiss-lib Newsletter (78 Fälle). Eine weitere Erklärung könnte auch sein, dass swissbib unter den Bibliothekaren einen gewissen Wert als Arbeitsinstrument besitzt. An der Stelle eine Information, die laut den Feedbacks in der Umfrage anscheinend nicht allen bekannt ist: der Metakatalog swissbib und die swiss-lib-Mailingliste haben nichts miteinander zu tun.

Sehr viele Teilnehmende hinterliessen uns ein zusätzliches Feedback (42 % aller Personen haben im Freitextfeld eine Rückmeldung, Lob, Kritik oder Verbesserungsvorschläge notiert). Diese reichen von einfachem Lob («Ich wüsste tatsächlich nichts, was man an diesem mir schon sehr ans Herz gewachsenen System ändern sollte. Toll!») über humorvolle («Ein Kaffeeautomat am Eingang (grins)») oder wohl ernster gemeinte Verbesserungsvorschläge («schön wäre es natürlich, direkt aus Swissbib ein Buch bestellen zu können, ohne in den lokalen Katalog umzuschalten! Aber das wird wohl erst mit SLSP kommen... ») bis hin zu – durchaus berechtigter – Kritik («Les données sont parfois à double, mais j'imagine que c'est difficile de réussir à identifier toujours les notices entre divers catalogues.»). In den kommenden Wochen werden wir uns ausgiebig der Vielzahl an Freitextkommentaren widmen und mögliche Verbesserungsmassnahmen daraus ableiten.

Donnerstag, 7. Dezember 2017

Was ist neu in swissbib? / Quoi de neuf dans swissbib?

Deutsche Version Version française

Liebe Blogleserinnen und Blogleser
In diesem Jahr war es relativ ruhig auf unserem Blog! Dabei gibt es eine Menge neue Funktionen, die wir schon längst vorstellen wollten. Mit dem hier folgenden Überblick holen wir das nun nach. Wir freuen uns auf eure kundige Einschätzung und euer Feedback.

Datenquellen


Die Dokumente der folgenden Quellen sind neu in swissbib zu finden:
Bis zum Jahresende werden wir ausserdem noch die folgenden Quellen integrieren:
  • Die im Volltext frei zugänglichen Dokumente der Forschungsplattform Alexandria der Universität St. Gallen.
  • Der Bestand der Kantonsbibliothek Thurgau

Nationallizenzen


Seit einigen Monaten haben Nutzer mit einem ständigen Wohnsitz in der Schweiz Zugang zu über 6 Millionen Dokumenten aus dem Projekt Nationallizenzen. Der Zugang und die Registrierung erfolgt über swissbib, in Partnerschaft mit dem Projekt SWITCH edu-ID (in swissbib anschauen).

Über die Nationallizenzen wird zudem die Open-Access-Publikation von Artikeln ermöglicht, die von Autoren, die einer Schweizer Institution angegliedert sind, verfasst wurden. Die betroffenen Metadaten und Volltexte wurden von swissbib aufbereitet und über RERO DOC veröffentlicht. Die Daten stehen auch für die Integration in die Institutionellen Repositories der Schweizer Hochschulen zur Verfügung.

Weitere Informationen sind in unserem Schlussbericht zum Projekt Nationallizenzen zu finden.

Linked Open Data


Das Projekt linked.swissbib.ch wurde Ende April 2017 abgeschlossen. Wir sind gegenwärtig damit beschäftigt, die Projektergebnisse im Hinblick auf eine Integration in swissbib zu konsolidieren.

Ein wichtiger Schritt war die Identifizierung und Kennzeichnung der offenen Metadaten. Wir freuen uns, dass inzwischen 85 % aller Daten von swissbib als Public Domain zugänglich sind (anschauen).

Für die Neugierigen unter euch: Werft gerne einen Blick auf data.swissbib.ch und linked.swissbib.ch, um zu sehen, was euch zukünftig erwartet. Die Portale sind aber erst als Beta-Version veröffentlicht. Wir befinden uns noch in der Konsolidierungsphase.

In einer Artikelserie in unserem Blog haben wir die verschiedenen Prozesse beschrieben. Ausserdem wurde ein Artikel zum Thema Interlinking Large-scale. Library Data with Authority Records publiziert.

Neue Funktionen


  • Verbesserte Facettensuche: Es ist neu möglich, Suchbegriffe durch Klicken auf das Kreuz rechts des Begriffs auszuschliessen. Mehrere gewählte Themen werden durch UND verknüpft. Die anderen Begriffe (Autoren, Sprache usw.) werden durch ODER verknüpft. Die gewählten sowie die ausgeschlossenen Suchbegriffe sind im Bereich «Filter löschen» sichtbar (weitere Informationen).
  • Verbesserte Anzeige der Hierarchie in den Archivbeständen: Zahlreiche Archivbestände sind in einer hierarchischen Struktur geordnet. In bestimmten Fällen kann diese Struktur im Reiter «Archive/Bestände» in swissbib angezeigt werden. (Beispiel).

Informationen zum System


  • Unser Datenverarbeitungstool CBS läuft inzwischen auf Version 8.
  • Das Update zur Version 4 unseres Discovery Tools VuFind ist praktisch abgeschlossen.
  • Alle unsere Server laufen nun unter Ubuntu 16.04.
  • Wir haben ein neues Statistik-Tool eingeführt, das auf der Analyse der Logs mit Elastic, LogStash und Kibana basiert.
  • Wir haben Sahi für automatisierte Tests der Web-Interfaces eingeführt.

Strategie und Zukunft von swissbib


Ende März 2018 wird die Finanzierung von swissbib durch swissuniversities auslaufen. Gegenwärtig sind wir dabei ein Modell der direkten Finanzierung durch die Bibliotheken einzuführen. Ausserdem planen wir die Integration von swissbb in die Swiss Library Service Platform (SLSP).

In diesem Rahmen:

Und zum Schluss noch einige Zahlen


swissbib zählt heute:
  • Über 30 Millionen Dokumente
  • Über 100 Millionen Exemplare, die in Schweizer Bibliotheken, Archiven oder online zugänglich sind
  • 90’000 Besucherinnen und Besucher pro Monate, die in dieser Zeitspanne 1,3 Millionen Seiten besuchen
  • 5 Personen, die am Projekt arbeiten (das Pensum entspricht 3 Vollzeitstellen)

Freitag, 1. April 2011

Das erste Jahr Zugriffsstatistik

Seit Anfang April 2010 erheben wir mit einem vernünftigen Modell Nutzerzugriffe auf swissbib. Wir zählen jene Zugriffe auf die Startseite, auf die eine Suche folgt.

Der grundsätzliche Trend ist positiv. Zunahme und Rückgang folgen dem Rhythmus der Semesterferien: Im September ist ein massiver Zuwachs festzustellen, im Januar ein bemerkenswerter Rückgang. Seit Februar geht es wieder aufwärts.

Es freut uns besonders, dass sich die Werbung mit swissbib-Flyern und Informationsoffensive im April und Mai 2010 direkt auf die Zugriffszahlen ausgewirkt hat. Ausserdem macht sich der Einbezug von swissbib in die Schulungsprogramme der Bibliotheken klar bemerkbar.