resume-get.

查看研究 · 发布版本 2026-07-v2

简历解析实验室

文档、提取的文本与失败案例并排展示。

通过 PDF 和 DOCX 文本提取器(即 ResumeGet 上传功能所用)运行的版本化合成语料库。每个测试集、原始输出、结果标签、方法、限制条件和校验码均公开透明。

PDF 和 DOCX 文件
20
合成版式
10
风险模式
11
已发布
2026年7月26日

研究边界

本次发布涵盖与未涵盖的内容。

测试单一真实流程

每个文件均通过 ResumeGet 的生产环境 PDF 和 DOCX 文本提取函数运行。结果均为观察所得,而非估算。

仅使用合成数据

姓名、雇主、机构、联系方式、URL 及成就均为虚构,专用于测试。

不认证任何 ATS

本实验室不会复现、排名或保证任何第三方招聘系统或雇主配置的行为表现。

观察结果

所有结果,包括失败案例。

每个结果检查十个已披露标记及其顺序。“保留”并非通用兼容性声明;仅表示本提取器在本发布版本中按序列找到了这些标记。

14

已保留

1

重排

5

内容丢失

0

无法读取

显示中 20 条结果

baseline-single-column.pdf

Baseline single column

已保留

A conventional one-column resume with contact details in the main document flow.

测试集标题、风险模式和原始文件保留为英文,以确保所有本地化页面指向相同的技术证据。

找到的标记
10/10
字符数
1,355
风险模式
single column baseline

观察到的问题

本次观察中未发现任何缺失或顺序错误的已披露标记。

结果判定方法

四种限定标签,无神秘评分。

01

已保留

所有披露的标记均出现在预期顺序中。

02

重排

所有披露的标记均已出现,但至少有一个不在预期的阅读顺序中。

03

内容丢失

提取完成,但至少缺少一个已披露的标记。

04

无法读取

生产环境提取器拒绝该文件或返回字符数少于 120 个。

发布文件

检查或复现每一项声明。

本次发布提供人类可读和机器可读两种格式。SHA-256 校验码覆盖所有已发布文件(校验列表本身除外)。

面向职业导师

运行一场无需收集参与者简历的 45 分钟解析工作坊。

教学套件利用成对的合成测试集,对比视觉层级与提取的阅读顺序。包含无障碍文本替代方案及二维码旁的规范 URL。

  • 限时议程与学习目标
  • 渲染文件与原始文本的配对练习
  • 引导员指南、隐私说明及无障碍提示
  • 四组已就绪的测试集对,适用于小组 session
ResumeGet 简历解析实验室二维码
resume-get.com/research/resume-parsing-lab

复用与引用

使用本材料。请引用发布版本,而非承诺内容。

书面材料与合成测试集内容均遵循 CC BY 4.0 协议。只需提供纯文本署名即可;无需超链接、互惠链接、注册、付费、背书或有利结果。

ResumeGet Resume Parsing Lab, release 2026-07-v2, https://resume-get.com/research/resume-parsing-lab
阅读复用条款

相关路径

应用发现成果或开展教学。