Wie stellt Opportunity Universe die weltweit größte Datenbank von Programmen bereit?
Diese Seite dokumentiert, wie Opportunity Universe die veröffentlichten Chancen entdeckt, extrahiert und überprüft. Die Plattform beruht auf einer automatisierten Crawling- und Extraktionspipeline, die große Sprachmodelle mit deterministischen Validierungsregeln verbindet. Die folgenden Abschnitte beschreiben jede Stufe dieser Pipeline, von der Erfassung der Quellen bis zur täglichen Archivierung, und nennen die Kennzahlen, die das System derzeit erreicht.
Der Crawler überwacht drei Arten von Quellen.
Da primäre Herausgeber direkt indexiert werden, ist die Datenbank nicht darauf angewiesen, dass eine andere Plattform online, vollständig oder korrekt bleibt.
Jede Kandidatenseite wird an ein Sprachmodell übergeben, das zwei Aufgaben erfüllt. Es klassifiziert die Seite und trennt echte Ausschreibungen von Nachrichtenartikeln, Listenbeiträgen und bereits abgeschlossenen Ankündigungen. Anschließend extrahiert es einen strukturierten Datensatz mit Titel, Veranstalter, Frist, Teilnahmevoraussetzungen, Förderart, Ort und Bewerbungslinks. Die Ausgabe wird gegen ein kontrolliertes Vokabular von Typen, Fachgebieten und Regionen validiert, sodass jeder Datensatz maschinell vergleichbar ist und nicht nur aus Freitext besteht.
Ein einzelnes Programm wird häufig auf vielen Websites erneut veröffentlicht. Das System führt diese Veröffentlichungen anhand von Titelähnlichkeit, Identität des Veranstalters und zeitlicher Nähe der Frist zu einem kanonischen Datensatz mit mehreren ausgewiesenen Quellen zusammen. Wiederkehrende Programme werden zusätzlich zu Serien verknüpft. Wenn eine Ausgabe endet, prüft die Pipeline die Serie in regelmäßigen Abständen erneut, sodass die folgende Ausgabe erkannt werden kann, sobald sie angekündigt wird.
Jeder veröffentlichte Datensatz verweist auf die Website des Veranstalters und auf die offizielle Bewerbungsseite. Die Plattform verlinkt nicht auf andere Aggregatoren und leitet Bewerberinnen und Bewerber nicht über Weiterleitungen oder Tracking-Zwischenstellen. Bewerbungen werden daher immer direkt an der Quelle eingereicht.
Jeder Datensatz trägt drei unabhängige Bewertungen: Extraktionskonfidenz, Ansehen des Veranstalters und Seriosität. Datensätze unterhalb des Konfidenzschwellenwerts werden nicht in den öffentlichen Index aufgenommen und zur Prüfung eingereiht. Ansehen und Seriosität fließen in die Rangfolge ein, sodass etablierte und vollständig finanzierte Programme vor ungeprüften Einträgen erscheinen.
Quellen werden nach individuellen Zeitplänen synchronisiert, die abbilden, wie häufig sie veröffentlichen. Plattformen mit hohem Aufkommen werden alle paar Tage erneut gelesen, primäre Herausgeber wöchentlich bis monatlich, und der internetweite Durchlauf erfolgt monatlich. Fristen werden täglich ausgewertet und abgelaufene Einträge automatisch archiviert, sodass der durchsuchbare Index Chancen abbildet, die tatsächlich offen sind.
Redaktionell kuratierte Plattformen veröffentlichen das, was ein kleines Team an einem Arbeitstag lesen und schreiben kann, was sie in der Praxis auf wenige Einträge pro Tag beschränkt, überwiegend auf Englisch und überwiegend aus Quellen, die sie ohnehin bereits verfolgen. Eine automatisierte Pipeline liest dieselben Quellen, ergänzt die dahinterstehenden primären Herausgeber und arbeitet ununterbrochen in jeder Sprache, die sie abdeckt. Dieser Unterschied im Durchsatz, und nicht ein Unterschied im redaktionellen Urteilsvermögen, erklärt die im Diagramm unten gezeigte Lücke.
Das Diagramm vergleicht die Anzahl der pro Monat von Opportunity Universe veröffentlichten Chancen mit dem Volumen, das auf der größten anderen Chancen-Plattform gemessen wurde. Die Volumina der anderen Plattformen werden direkt aus deren öffentlichen Feeds erhoben; unsere Zahl zählt eindeutige Chancen nach der Deduplizierung über alle Quellen hinweg.
Die Monatswerte sind geschätzt, wenn eine Plattform keine Datumsangaben veröffentlicht. Die Gesamtzahlen sind exakt.
Nachstehend finden Sie eine Liste weiterer Chancen-Plattformen, deren Einträge ebenfalls in dieser Datenbank enthalten sind. Jedes Programm, das sie veröffentlichen, wird gelesen, strukturiert und mit dem zusammengeführt, was wir an der Quelle finden, sodass der Index ihre Abdeckung zusätzlich zu unserer eigenen enthält. Die Zahl gibt an, wie viele unterschiedliche Chancen wir über die jeweilige Plattform gefunden haben.
| Chancen-Plattform | Gefundene Chancen |
|---|---|
|
|
4.752 |
|
|
3.416 |
|
|
2.720 |
|
|
2.542 |
|
|
2.209 |
|
|
1.660 |
|
|
1.287 |
|
|
1.253 |
|
|
1.165 |
|
|
1.018 |
|
|
956 |
|
|
939 |
|
|
790 |
|
|
773 |
|
|
765 |
|
|
709 |
|
|
709 |
|
|
628 |
|
|
557 |
|
|
543 |
Weitere Quellen steuern jeweils weniger als 500 Chancen bei und werden nicht einzeln aufgeführt.
Erhalte jede Woche die besten neuen Stipendien, Wettbewerbe und Programme direkt in dein Postfach, abgestimmt auf dein Land, dein Niveau und deine Interessen.