先给结论:近期长文主要由连续正文构成,不是靠列表和模板凑出来的

我们固定 2026 年 8 月 29 日的 main 提交 79a4a8ecd17edfc79d4147b57f201f79bc0d9f3c,读取 sitemap 中全部 31 篇文章详情页,排除页头、页脚、导航、结构化数据、相关阅读和返回入口后,重新统计正文。31 篇合计 184,475 个中文字符,中位数 6,108,平均 5,951;连续段落贡献 84.1%,列表项与表格单元格合计占 11.5%。按至少 40 个中文字符的段落标准化后,没有发现跨文章逐字重复的正文段落。

结果不能解释成“所有文章都足够长”。31 篇中有 7 篇少于 5,000 个中文字符,其中 2 篇少于 3,000;这些短文全部发布于 2026 年 8 月 7 日以前。8 月 7 日及以后发布的 23 篇平均 6,611 个中文字符,没有一篇低于 5,000,20 篇达到 6,000。真正的结论是:当前发布流程已经明显转向长篇连续论述,但早期内容仍存在长度与结构差异,不能用近期文章表现覆盖整个资料库。

31 篇固定提交文章样本
6,108正文中文字符中位数
84.1%连续段落字符占比
0 组跨文章重复长段落

一、为什么要查“正文结构”,而不只看一个字数

长文不一定有深度。五千个字符可能来自完整论证,也可能来自目录、卡片标题、表格重复、检查清单和固定模板;相反,一篇较短的实测记录如果公开了测试条件、原始观察和局限,仍然可能有用。只报告总字数,会把内容长度和信息质量混成一件事。

这次审计把问题拆成四层。第一层是页面在排除重复模板后到底有多少正文中文字符;第二层是连续段落占多少,列表与表格占多少;第三层是不同文章之间是否直接复用了长段落;第四层是早期文章与当前发布流程有没有结构变化。四层合在一起,才能回答“长文是不是主要靠正文推进”。

需要先说明,段落占比不是质量分。连续段落可能空洞,表格也可能高度有效;列表使用多并不自动等于 PPT 化。它们只是结构信号。文章是否真正回答标题、论据是否可靠、段落是否提供新信息,仍然需要人工阅读。本文不会把 HTML 统计包装成模型理解能力或搜索效果。

二、样本如何固定:31 篇来自同一个 main 提交

样本不是从内容中心页面手工抄标题,而是从固定提交中的 public/sitemap.xml 提取 basics、methodology 和 tests 三个目录下的文章详情 URL,排除三个分类首页,共得到 31 篇。随后逐一读取同一提交中的 index.html。这样即使网站明天新增文章,本文的分母仍然可复算。

我们没有把首页、内容中心、分类页、白皮书和关于页混进来,因为这些页面承担导航或转化任务,结构与深度文章不同。31 篇中包含基础 FAQ、自测教程、方法论、趋势观察、模型提问记录和本站技术审计;文章类型并不一致,因此不能要求它们拥有相同长度和相同组件数量。

固定提交还解决了线上边缘改写问题。此前公开部署一致性审计发现,Cloudflare 可能注入统计脚本或进行邮箱保护;这些变化会改变原始 HTML,却不等于正文被篡改。本次统计直接读取仓库中的发布源,不把边缘脚本、缓存节点或浏览器渲染差异算进正文。

三、正文字符如何计算:这次使用更严格的边界

每篇页面先定位 section.article-body 内的 article,再删除相关阅读区和返回内容中心入口。随后移除 HTML 标签、脚本、样式与常见实体,只统计 Unicode 中日韩统一表意文字范围内的字符。英文模型名、数字、标点和空格不进入中文字符数;因此它不是通常意义上的“字数”或页面总文本长度。

这套口径比发布时对整段 article 容器的快速计数更严格:相关阅读卡片虽然属于文章页面,却不算核心正文。读者因此可能看到本文复算值与某些发布报告相差几十到一百多个字符。差异来自边界,不代表文章内容减少。以后需要长期比较时,应固定同一提取规则,不能一轮包含相关阅读、下一轮又排除。

项目本次是否计入原因
正文段落与正文小标题计入承担核心解释与判断
正文表格、清单与可引用要点计入属于文章实际内容
文章导语不计入位于 article 外的 hero,避免重复摘要
相关阅读与返回入口不计入属于跨文章导航
JSON-LD、meta 与导航页脚不计入属于机器元数据或公共模板
英文、数字、标点和 HTML不计入本次只比较中文字符

这种计算仍然不是语言学上的完美分词。例如“AI”“GEO”“JSON-LD”会影响语义,却不会增加中文字符;代码示例和 URL 也可能携带重要信息。本文把中文字符作为可重复的长度代理,用结构占比和人工边界说明来补足,而不把它当成唯一质量标准。

四、整体长度分布:中位数比平均数更能说明典型文章

31 篇合计 184,475 个中文字符,平均 5,951,中位数 6,108。中位数略高于平均数,原因是资料库里有几篇早期短文拉低平均值。最长的是“GEO 证据链”指南,严格口径下为 8,706 个中文字符;最短的是“地域品类与全国品类对照”实测,为 2,413 个。

20 篇达到 6,000 个中文字符,4 篇位于 5,000 至 5,999,7 篇低于 5,000。低于 5,000 不应自动判为失败,因为实测篇幅必须服从真实材料,基础 FAQ 也可以用较短篇幅完整回答。但当标题承诺“完整指南”“深度分析”或覆盖多个判断问题时,较短正文需要人工确认是否真的覆盖机制、做法、反例和边界。

两篇低于 3,000 的文章分别是早期的内容更新判断文章和两类推荐问题对照。它们并没有因此被本文标记为错误;这两篇的结构化字符占比分别为 26.3% 和 28.0%,说明正文更依赖表格与清单,也说明当时网站更偏向紧凑卡片式表达。它们适合进入内容复核队列,但不能仅凭长度立即扩写。

五、近期发布流程发生了什么变化

把 2026 年 8 月 7 日作为分界,结果很清楚。此前共有 8 篇文章,平均 4,053 个中文字符,中位数 4,413;7 篇低于 5,000,没有一篇达到 6,000。其连续段落占比为 76.2%,列表和表格占 18.1%。这批内容包含基础教程、早期模型记录和较短方法文章,结构更依赖清单、对照和卡片。

8 月 7 日及以后共有 23 篇,平均 6,611,中位数 6,369,最短 5,420,最长 8,706;20 篇达到 6,000。连续段落占比提高到 85.8%,列表和表格降到 10.1%。这说明长度增加的主要来源不是堆更多列表,而是增加连续解释、判断机制、边界与复盘。

但时间分组只能描述编辑流程变化,不能证明近期文章一定更好。早期两篇真实模型提问记录受原始材料限制,不应该为了达到新长度目标虚构更多回答;近期方法论适合长写,本来就会产生更多段落。文章类型和发布时间同时变化,因此不能把全部差异归因于“质量提升”。

六、连续段落占 84.1%,这个数字能说明什么

我们提取正文中的所有 p 元素,统计其中的中文字符。31 篇共有 1,620 个正文段落,合计 155,169 个中文字符,占全部正文的 84.1%。剩余部分由标题、表格、列表、短标签、代码和其他结构文本构成。就“是否靠列表撑长度”这个问题,答案是否定的:大部分字符确实位于连续段落。

单篇最低段落占比为 64.2%,对应最短的两类推荐问题对照实测;第二低为 67.9%,对应内容更新判断文章;第三低为 71.1%,对应十分钟自测教程。这三篇同时拥有较高的表格或列表占比,适合人工检查卡片是否替代了应有解释。近期长文的段落占比通常在八成以上。

段落多也有另一种风险:文章可能把同一观点拆成许多相似段落,形式上连续,信息却不增加。因此我们还检查跨文章精确重复,并在写作规则中保留“每段必须提供新信息”的人工要求。结构统计只能排除一种明显灌水方式,不能证明每段都不可删除。

七、列表和表格占 11.5%,为什么不能简单追求更低

31 篇全部包含至少一张表和一个列表,合计 45 张表、488 个列表项。表格多用于测试条件、变量对照和判断矩阵;列表多用于检查清单、来源清单与可引用要点。它们合计承担 21,299 个中文字符,占全部正文 11.5%。这个比例没有官方合格线,只能用于发现异常。

如果一篇操作指南完全没有清单,用户执行时可能更困难;如果实测记录不用表格,测试条件和结果可能被埋在长段落中。问题不在于结构组件出现,而在于它们是否替代关键解释、是否重复正文、是否为了视觉丰富把一个连续论证切成十几张卡片。

这次没有逐项判断 488 个列表项是否必要,也没有把卡片内的 p 与普通段落分开。部分卡片仍使用段落标签,因此“连续段落占比”会包含卡片里的短解释。若以后要做更细审计,可以增加 DOM 类名分类,但必须先统一历代模板,否则同样内容会因类名不同被错误分组。

八、跨文章重复检查:零组不代表没有概念复用

我们抽取每个正文段落,去除空格和常见中英文标点,只保留至少 40 个中文字符的段落;同一标准化文本如果出现在两篇或更多文章,就计为跨文章重复组。结果为 0 组。也就是说,在这个阈值下,没有发现整段逐字复制到另一篇文章的情况。

这项结果不能证明文章之间没有观点重叠。GEO 资料库反复讨论事实一致性、证据、抓取、引用、复测和“不保证推荐”,相同概念会以不同语境出现。选题冲突要比较搜索意图、标题承诺、论证框架和下一步行动,不能只靠精确文本匹配。

反过来,精确重复也不一定全是坏事。引用统一免责声明、测试边界或官方定义时,保持措辞一致有助于避免歧义。真正需要避免的是用同一背景段落、同义改写和重复总结填充多篇文章。本文的零组结果说明没有明显整段复制,但近似重复仍需编辑人工判断。

九、为什么每篇都有表格和列表:固定骨架与内容组件要分开看

站点固定骨架包括面包屑、文章元信息、导语、正文容器、可引用要点、相关阅读和返回入口。此次计数排除了相关阅读和返回入口,但保留了正文内的可引用要点和检查清单,因为它们承载文章结论。所有文章都有列表,与“可引用要点”通常使用列表结构有关;所有文章都有表格,则说明历代模板普遍把对照信息放入表格。

固定骨架本身不是问题。读者需要知道标题、日期、栏目和下一步阅读,机器也需要 canonical 与 Article。问题是不同文章是否复制同一正文组件顺序。本站规范明确要求实测优先使用测试条件、原始观察、结果表和局限,方法论使用框架与判断矩阵;这次审计只看到标签数量,没有证明组件顺序已经充分多样。

如果把“每篇都有表格”解释成设计缺陷,也会过度推断。表格可能只有一张,且确实适合表达变量关系。下一轮人工审稿更应该抽查表格是否拥有明确表头、是否在移动端可横向滚动、单元格是否重复附近段落,而不是机械删除。

十、七篇短文应该怎样处理

第一步不是统一扩写,而是重新读标题。若标题已经被现有正文完整回答,且文章是有限样本实测,可以保留长度并补清测试条件;若标题承诺完整指南,却缺少判断标准、错误示例和边界,应优先补结构。短文名单是复核入口,不是自动改稿指令。

第二步检查事实时效。早期模型实测比一般方法文章更容易过期;补写时不能把 2026 年 7 月的回答假装成当前平台结果。可以新增观察日期、模型入口、原始问题和“本次记录不能代表现在”的提示,必要时重新测试并发布新版本,而不是用背景知识把旧样本硬扩到 6,000 字符。

第三步检查站内分工。较短的“内容更新后改旧页还是新写”与后来的产品生命周期、品牌纠错、事实底稿文章存在明确延伸关系。它可能更适合成为一个紧凑判断入口,通过自然内链把读者带到深入指南,而不是复制其他文章的全部内容。内容地图的目标是让每个页面承担清楚任务,不是让所有页面一样长。

十一、这次实测发现的三个真实改进方向

第一,统一正文字符统计口径。发布报告应明确是否包含导语、可引用要点和相关阅读,最好固定“article 核心正文、排除相关阅读和公共模板”的规则。否则不同日期的字数无法直接比较。第二,给早期 7 篇短文建立人工复核队列,按标题承诺、时效风险和证据完整性排序,不按字符数直接批量扩写。

第三,在自动检查中加入“结构占比异常”而不是硬阈值。例如连续段落低于某个观察线时提示人工复核,但不阻止发布;列表与表格比例明显高于站内中位水平时,检查是否存在重复解释。阈值应由站内历史分布校准,并保留文章类型例外,不能把统计工具变成新的写作模板。

本次没有修改任何旧文章正文,因为字符与结构统计本身不足以授权重写。我们只给与本文直接相关的HTML 语义结构实测补充双向入口,让读者能够把“标签是否规范”和“正文是否被组件切碎”两个问题连起来理解。

十二、字符占比为什么不能直接叫“信息密度”

信息密度至少涉及命题数量、事实新颖度、证据距离、解释必要性和读者理解成本,单靠字符无法测量。同样一百个中文字符,可能包含三个相互独立的事实,也可能只是在给一个概念补条件;一张表可能用很少字符表达复杂关系,也可能只是把段落拆成多列。本文因此使用“正文长度”“段落占比”和“结构化占比”,没有把它们改名为信息密度分数。

自动工具也很难判断一段背景是否必要。对熟悉 GEO 的读者,定义可能显得重复;对第一次接触的读者,同一段却是理解后续方法的前提。更可行的人工标准是逐段追问:删掉这段后,标题答案是否缺少机制、条件、证据或行动;这段是否只重复上文结论;它是否与本页用户任务有关。只有回答这些问题,才能决定段落保留还是删除。

列表和表格同样需要语义判断。若清单中的每一项都改变执行结果,它就是高密度内容;若表格只是把同一句话换成三列,它仍然是重复。以后即使建立自动评分,也应把它用作抽样和预警,不应让模型或脚本直接删除正文。编辑责任不能外包给一个看似客观的比例。

这也解释了为什么本文不发布“最佳段落占比”。84.1% 是当前站点的观察值,不是行业标准。方法论、FAQ、操作指南和实测记录需要不同结构;将来站点增加更多原始数据表,结构化占比可能上升,却不代表质量下降。可靠做法是与同类型文章和自身历史比较,再回到正文人工复核。

十三、六个常见误读

把 6,000 字符当成质量证书。长度只是下限参考,不能替代事实、机制、做法和局限。

看到列表多就判定灌水。检查清单和测试条件适合列表,关键是它们是否重复正文。

看到零重复就说没有内容重合。本次只查至少 40 个中文字符的标准化精确重复,不查同义改写和意图重叠。

把早期短文直接扩到统一长度。真实实测受原始材料限制,扩写不能制造新样本或当前结论。

把仓库统计当成模型解析结果。HTML 中有多少段落,不代表任何生成式平台已经抓取、理解或引用。

比较不同口径的发布字数。是否包含相关阅读、导语和英文数字,会让同一页面出现不同结果。

十四、可复用的正文结构审计流程

先固定提交和 URL 清单,明确分类首页是否排除;再定义正文容器、需要删除的导航模块和字符范围。每篇保存标题、发布日期、正文字符、段落字符、列表字符、表格字符、段落数、列表项数和表格数。计算整体分布时同时给平均数与中位数,避免短文或超长文扭曲典型值。

随后按发布时间和内容类型分组。时间分组能发现编辑流程变化,类型分组能避免用方法论标准苛求有限样本实测。重复检查至少保留标准化方法、最小长度和是否跨文章三个条件;报告零结果时也要写清它没有覆盖哪些近似重复。

最后把异常变成人工复核队列,而不是自动判错。优先阅读标题承诺较大、正文较短、结构化占比较高、时效风险较高的文章。人工检查每段是否增加信息、表格是否必要、清单是否可执行、结论是否有边界,再决定补写、合并、更新、保留或建立新基线。

正文长度与结构发布检查清单

  • 是否固定了提交 SHA、文章清单和审计日期。
  • 是否明确正文容器,并排除导航、页脚、相关阅读和结构化数据。
  • 中文字符口径是否说明英文、数字、标点和导语的处理方式。
  • 标题提出的问题是否被正文完整回答,而非只达到长度。
  • 连续段落是否承担主要解释,列表与表格是否服务于理解。
  • 表格、卡片和清单是否没有重复附近正文。
  • 短篇实测是否服从真实材料,没有为了扩写制造样本。
  • 重复检查是否公开标准化规则和最小段落长度。
  • 异常指标是否进入人工复核,而非直接判定质量。
  • 结论是否没有把 HTML 结构解释成模型抓取、引用或推荐保证。

十五、边界与局限

本次审计只分析仓库 HTML,不评价事实准确性、论据强度、语句流畅度和用户阅读完成率。段落字符包含卡片内使用 p 标签的文字,列表与表格字符也可能与段落统计存在视觉功能差异。字符属于结构代理,不是信息密度的直接测量。

跨文章重复检查只识别标准化后的逐字相同段落,不识别改写、翻译、相同论证顺序和共同模板短句。至少 40 个中文字符的阈值会排除短免责声明、栏目标签和固定提示;这是为了避免公共表达制造大量无意义重复,但也会漏掉较短的复用句。

时间分组没有控制文章类型。早期样本包含更多基础教程和有限模型记录,近期样本包含更多长篇方法与站内审计,因此不能把长度变化全部归因于写作流程。本文只能证明固定提交下的结构分布,不能证明近期文章更容易被任何模型理解。

本次可引用要点

  • 固定 main 提交中的 31 篇 GEOC 文章,排除公共模板和相关阅读后合计 184,475 个正文中文字符,中位数 6,108,平均 5,951。
  • 连续段落贡献全部正文中文字符的 84.1%,列表项与表格单元格合计占 11.5%;近期长文并非主要依靠列表和表格撑量。
  • 2026 年 8 月 7 日及以后发布的 23 篇文章平均 6,611 个中文字符,没有一篇低于 5,000;此前 8 篇平均 4,053,7 篇低于 5,000。
  • 31 篇共有 1,620 个正文段落、45 张表和 488 个列表项;所有文章都使用表格和列表,但组件存在不等于内容碎片化。
  • 按去除空格与常见标点、至少 40 个中文字符的规则,没有发现跨文章逐字重复的长段落;该结果不覆盖同义改写和搜索意图重叠。
  • 正文字符数是审稿入口,不是质量分,更不能证明模型已经抓取、理解、引用或推荐页面。

十六、下一步怎么做

最优先的动作不是把 7 篇短文全部扩写,而是固定字符统计脚本,并对早期内容逐篇核对标题承诺、事实时效、原始材料和站内分工。对于真实模型记录,先补条件和局限;对于方法入口,先判断是否已经由后续深度文章承接;只有确实存在答案缺口时才扩写。

如果要继续检查机器可解析的页面骨架,可以阅读31 篇文章之前的 HTML 语义结构审计;如果要判断文章之间是否重复争夺同一问题,则应结合用户问题与内容地图方法做人工意图审查。标签正确、篇幅足够、选题独立是三个不同问题,必须分别验证。