Opportunity Universe 如何呈现全球最大的项目数据库?
本页说明 Opportunity Universe 如何发现、提取并核实其所发布的机会。平台建立在一条自动化的抓取与提取流程之上,该流程将大语言模型与确定性的校验规则结合起来。以下各节依次描述该流程的每个阶段,从来源采集到每日归档,并列出系统目前产生的各项数据。
抓取程序监测三类来源。
由于原始发布方被直接编入索引,本数据库并不依赖于任何其他平台持续在线、内容完整或保持准确。
每个候选页面都会交给语言模型处理,模型执行两项任务。其一是对页面进行分类,将真正的申请征集与新闻报道、清单式文章和已结束的公告区分开来。其二是提取结构化记录,包含名称、主办方、截止日期、申请资格、资助类型、地点和申请链接。输出结果会依照类型、学科与地区的受控词表进行校验,使每条记录可供机器比对,而非仅为自由文本。
同一个项目常常被众多网站重复发布。系统依据标题相似度、主办方身份和截止日期的接近程度,将这些内容归并为一条标准记录,并标注多个来源。周期性举办的项目还会被关联为系列。当某一届结束后,流程会定期重新检查该系列,从而在下一届公布后立即将其发现。
每条发布的记录都会链接到主办方网站和官方申请页面。平台不会链接到其他聚合网站,也不会通过跳转或跟踪中介引导申请人。因此,申请始终在来源处提交。
每条记录都带有三项独立评分:提取置信度、主办方声誉和可信度。低于置信度阈值的记录不会进入公开索引,而是列入待审核队列。声誉和可信度会影响排序,使成熟且全额资助的项目排在未经核实的条目之前。
各来源按照各自的时间表同步,其频率取决于它们的发布频次。发布量大的平台每隔几天重新读取一次,原始发布方为每周至每月一次,覆盖全网的扫描每月运行一次。截止日期每天评估一次,过期条目会自动归档,以确保可检索的索引所反映的是确实仍在开放的机会。
由编辑筛选的平台,其发布量取决于一个小团队在一个工作日内能够阅读和撰写的内容,这在实际中使其每天只能发布少量条目,且以英语为主,来源也大多是它们已经在关注的网站。自动化流程读取的是同样这些来源,并补充其背后的原始发布方,同时以其覆盖的每一种语言不间断地运行。下图中的差距源于这种处理量上的差异,而非编辑判断力的差异。
该图表将 Opportunity Universe 每月发布的机会数量,与在最大的其他机会平台上测得的数量进行比较。其他平台的数量直接取自其公开信息流;我们的数字统计的是在所有来源之间去重后的不重复机会。
若平台不公布日期,每月数值为估算值。总计为精确数字。
下面列出的是其他机会平台,它们的条目同样收录于本数据库。它们发布的每一个项目都会被读取、结构化,并与我们在来源处找到的内容合并,因此本索引在自有内容之外还包含它们的覆盖范围。数字显示我们通过每个平台找到的不重复机会数量。
| 机会平台 | 已找到的机会 |
|---|---|
|
|
4,752 |
|
|
3,416 |
|
|
2,720 |
|
|
2,542 |
|
|
2,209 |
|
|
1,660 |
|
|
1,287 |
|
|
1,253 |
|
|
1,165 |
|
|
1,018 |
|
|
956 |
|
|
939 |
|
|
790 |
|
|
773 |
|
|
765 |
|
|
709 |
|
|
709 |
|
|
628 |
|
|
557 |
|
|
543 |
另有一些来源,每个提供的机会均不足 500 项,因此未单独列出。
每周将最新的优质奖学金、竞赛与项目直接发送到你的邮箱,并根据你的国家、学历和兴趣精准匹配。