Usenet归档工具包 - 将Usenet消息处理成可搜索的归档
Usenet归档工具包项目旨在提供一套工具,将各种来源的Usenet消息处理成一个连贯的、可搜索的归档。通常您将有两种使用模式:您有一个已经创建的归档文件,您想要阅读。为此,您只需下载或构建tbrowser实用工具。您想要从可用的来源创建一个归档文件。您需要使用大部分提供的实用工具。遵循工作流图是一个很好的起点。总结:下载可用的归档文件,使用tbrowser进行阅读。UAT归档文件列表:波兰Usenet归档: https://usenet.nereid.pl/ . PC游戏Usenet归档: https://archive.org/details/usenet-uat-pc-games . 动机:Usenet已经死了。您可能不相信,但它确实已经死了。2016年8月至2016年12月的波兰Usenet消息数量(大致)。人们已转向各种论坛、Facebook和Twitter,并在那里似乎过得很好。与此同时,旧的讨论慢慢腐烂。Google群组是一个悲伤且不可用的笑话。Archive.org的数据集,至少就波兰Usenet归档而言,极其不完整。没有简单的方法获取数据、浏览或搜索它。因此,也许需要做点什么。到底有多难呢?(不难:一个月可以实现一个工作的原型,另一个月用于完善和修复错误。)优势:为什么使用UAT?为什么不使用现有的解决方案,如Google群组、archive.org的归档或拥有悠久历史的NNTP服务器?UAT是为了离线工作而设计的。您不需要网络连接来访问“云”中的数据。您不需要等待对查询的回复,或者,天哪,忍受“Web 2.0”界面。UAT归档不会突然消失。您将它们保存在您的磁盘上。Google群组随着每次新界面的更新而恶化。此外,Google因关闭他们不再认为可行的服务而闻名。Google阅读器、Google代码搜索、Google代码等。其他较小的服务离完全从网络消失只有一次磁盘崩溃的距离。UAT归档格式旨在实现快速访问和高效搜索。每条消息都是单独压缩的,以便实现即时访问,但使用整个归档字典来实现更好的压缩。搜索是通过类似于谷歌原始论文的数据库实现的。总归档大小小于未压缩的消息集合。多个消息来源可以合并为单个UAT归档,而不会出现消息重复。通过这种方式,您可以用源A(例如NNTP归档服务器)的消息填充空缺,源B(例如更小的archive.org转储)的消息也可以被填充。以这种方式创建的归档是可用的消息最完整的集合。UAT归档不包含重复消息(即使在NNTP服务器上也很常见),也不包含来自其他组的孤立消息(archive.org集合中包含许多虚假消息)。其他Usenet归档充满了垃圾邮件消息。UAT可以筛选垃圾邮件,使以前不可读的新闻组变得易于阅读。经过适当训练的垃圾邮件数据库具有非常低的误报和漏报率。所有消息都被转码为UTF-8,因此可以使用普通客户端进行显示。UAT非常努力地试图正确解码损坏和/或完全无效的标题、未指定编码或编码错误的消息。消息的HTML部分被删除。您还无需担心解析quoted-printable内容(最有可能是格式错误的)。而且不要忘记搜索。没有UAT就享受grep那个base64编码的消息吧。UAT归档包含预先计算的消息连接图,这消除了解析“引用”头(通常是损坏的)、按日期对消息进行排序等工作的需要。UAT还可以通过在其他消息中搜索引用文本来“恢复”未在消息头中指示的缺失连接。通过简单的libuat接口访问归档。UAT归档映射到内存,并完全以磁盘为备份。在内存压力大的情况下,归档页面可能会被清除,然后按需重新加载。正常libuat操作期间不需要内存分配,除了:用于将单个消息解压缩的少量静态增长缓冲区。在搜索操作期间使用的std::vector。这样的设计在tbrowser中表现明显,只需每条消息10字节用于记录。显示250万条消息的分组所需的总内存仅为25 MB。工具包描述:UAT提供了大量实用工具,每个工具专门用于自己的任务。您可以在下面找到对每个工具的简要描述。导入格式:Usenet消息可以从多种不同来源获取。目前我们支持:import-source-maildir --- 从树目录导入,每个文件都是单独的消息(例如,slrnpull在额外简单的设置下生成此结构)。import-source-maildir-7z --- 从压缩为单个7z压缩文件的maildir树导入。import-source-mbox ---
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡