商品描述空了5537件,其中2542件出自同一个站
本文目录
- 43912件商品里,有5537件的描述栏是空的
- 这个12.6%,为什么剔掉一个站就掉到7.2%?
- 空描述的56个站,是同一种毛病吗?
- 那5537件空,拆开是哪几种空?
- 站级:这个站根本不用这一栏
- 这条根本不是货
- 占位、测试和半成品
- 剩下1748件,是确定要补的那一批
- 接口里是空的,页面上就一定没字吗?
- 接口说空的,一多半页面上也是真的空
- 把账重新算一遍
- 中间那36.6%才是真正需要小心的一档
- 顺手量到的另一件事:填了也未必全都进去
- 缺描述的商品,是不是别的地方也缺?
- 新上架的商品反而更容易没描述
- 另一头:有人把整个落地页塞进了这一栏
- 这一栏到底该由谁负责填?
- 自己的站怎么把这笔账算准?
- 常见问题解答
- 商品描述为空,Google会不会直接不收录这个页面?
- 那接口里没有、页面上有,算不算问题?
- 礼品卡、运费险这类条目,要不要写描述?
- 为什么新品的空描述率反而比老品高?
- 把整个页面塞进描述字段,除了体积还有什么坏处?
- 用无头浏览器抽验,抽多少件才够?
- 这批数字能直接拿去跟自己的站比吗?
- 权威参考资料
摘要:43912件在售商品里有5537件没有商品描述,占12.6%。剔掉一个站之后这个数字掉到7.2%,剔掉五个站掉到4.7%——2542件空值出自同一家,它整站99.5%的商品都不用这一栏。逐条归因之后,确认不该算的有1247件——非商品条目、半成品和占位块,没有一件需要写文案。剩下的4290件才是真缺,占9.8%;把那个整站不写描述的站剥出去,其余站的漏填是1748件,八成挤在7个站上。另一头还有978件商品的描述超过5000字符,最长的一条55238字符,抵得上一篇白皮书。
43912件商品里,有5537件的描述栏是空的
这是一个看上去很值得开会的数字:12.6%的在售商品没有商品描述。
样本是60个英文独立站的公开商品清单,最后56个站拿到了完整数据,走的是那个不用登录就能拿走250条的出口。描述字段读的是商品对象上那个装商品正文的字段,字符数为0就算空。43912件里有5537件为0,一件不多一件不少。
商品描述值不值得较真,这事没什么争议:它是商品详情页上唯一能做出差异的那块内容,同品类的参数、价格、图片在几百个站上长得都差不多。所以“缺了12.6%”听上去确实像笔该还的债。
如果这份报告到此为止,接下来的动作大概是给内容团队派一张“补齐12.6%商品描述”的工单,按每件20分钟估,5537件是1845个工时。
那张工单一开头就错了。这5537件里有1247件根本不需要文案,而剩下的4290件也不是一种毛病——其中2542件出自同一个站,是那个站从建站起就没打算写商品描述;散在其余站上的只有1748件,八成还挤在7个站里。
把这三档拆开各花了一步,最后一步得靠浏览器打开真页面才做得成。下面按顺序走一遍。
这个12.6%,为什么剔掉一个站就掉到7.2%?
先做一件最省事的事:按站算一遍,然后从最严重的那个开始往外拿,看整体数字怎么走。
| 样本范围 | 空描述/商品数 | 整体空率 |
|---|---|---|
| 全部56个站 | 5537 / 43912 | 12.6% |
| 剔掉marinelayer.com | 2995 / 41356 | 7.2% |
| 再剔掉peakdesign.com | 2844 / 41148 | 6.9% |
| 再剔掉casper.com | 2720 / 40933 | 6.6% |
| 再剔掉parachutehome.com | 1931 / 39362 | 4.9% |
| 再剔掉framebridge.com | 1832 / 39123 | 4.7% |
拿掉一个站,行业指标腰斩。marinelayer一家贡献了2542件空描述,占全部空值的45.9%,而它只占样本商品的5.8%。这个站的2556件商品里有2542件描述为空——空率99.5%。它不是漏填,它是整站不用这个字段。
五个站拿掉之后,剩下51个站的整体空率是4.7%。同一批数据,同一个字段,12.6%和4.7%都是对的,区别只在于你有没有先看分布。
空描述的56个站,是同一种毛病吗?
不是。把56个站按空率分档,形状是两头沉的:
| 该站空率 | 站数 | 商品数 | 其中空描述 |
|---|---|---|---|
| 正好0% | 17 | 14614 | 0 |
| 0%到2% | 10 | 13430 | 61 |
| 2%到10% | 10 | 4130 | 265 |
| 10%到30% | 11 | 5806 | 1062 |
| 30%到60% | 6 | 3168 | 1456 |
| 60%以上 | 2 | 2764 | 2693 |
27个站——将近一半——在这件事上几乎是满分:28044件商品里只有61件空。另一头2个站的2764件商品里空了2693件。中间那段才是常规意义上的“有点漏”。
把两头拉平取一个12.6%,等于把“完全不用这个字段的站”和“偶尔漏填的站”按人头平均。这跟行业榜单上那个前1%到底是几家是同一类账:平均数本身不撒谎,它只是把你最需要看见的那件事盖住了。
那5537件空,拆开是哪几种空?
我给每一件空描述的商品跑了一遍归因,判据按优先级排:先看它所在的站是不是整站不用这个字段,再看它的地址像不像占位或测试,再看这条记录是不是压根不是货,再看它其余字段是不是也空着,都不是才算“像是真漏了”。
| 这是哪一种空 | 件数 | 占5537件 |
|---|---|---|
| 站级:这个站根本不用这一栏 | 2542 | 45.9% |
| 这条根本不是货 | 1001 | 18.1% |
| 整条记录都是半成品 | 221 | 4.0% |
| 条目本身是占位或测试 | 25 | 0.5% |
| 剩下的,像是真漏了 | 1748 | 31.6% |
站级:这个站根本不用这一栏
2542件,全部出自marinelayer一家。一个站99.5%的商品都不填这一栏,这不是漏,是这个站压根不这么用它。
但“不这么用”有两种可能,处理方式正好相反:一种是描述换了个地方存,比如放在主题模板或者自定义字段里,那前台是有文案的,这一栏空着没关系;另一种是整站就真的没有商品描述。接口数据分不出这两种,得去页面上看。这个问题先挂着,后面有一节专门回答它。
这条根本不是货
1001件,18.1%。这一类最有意思。我用一组关键词扫商品的类目、品牌、地址和标题,命中的有2296件(占全样本5.23%,分布在52个站):运费险、延保、礼品卡、面料小样、碳中和抵扣、订阅计划、赠品捆绑。
典型长相是这样的:free-returns-coverage、alo-e-gift-card-black、womens-runner-protect-natural-black。它们在商品库里是商品,在结算流程里是一行价格,但它们没有商品描述是完全正常的——没人需要为一张礼品卡写三百字文案。
这2296件的空描述率是43.9%,而未命中的普通商品只有10.9%,前者是后者的4倍。这条差距本身就是判据:如果你的空描述里大比例是这类条目,那不是内容欠债,是统计口径没把非商品排除掉。
顺便解释一下上面那张表为什么写的是1001而不是1008:归因是按优先级往下走的,有7件非商品条目本身就在marinelayer那个整站不用这一栏的站里,已经被前一档收走了。两个数字都对,分母不同而已。
占位、测试和半成品
占位与测试类只有25件,0.5%,比我预期的少得多——地址里带spacer、placeholder、test、copy-of这类词的商品,绝大多数其实是有描述的。另有221件是“整条记录都是半成品”:描述空、类目空、标签也是0。这221件才是真正意义上的建了个壳没填完。
剩下1748件,是确定要补的那一批
31.6%。折算到全样本是3.98%。
先说清楚这个数字是什么:它是下限,不是最终答案。因为上面那张表里最大的一档还悬着——marinelayer那2542件到底该不该算,接口数据回答不了。所以现在手里有两个数:确定要补的1748件,和待定的2542件。
不管待定那批怎么落,能确定的是1247件该扣:非商品条目1001件、半成品221件、占位25件。这1247件占了全部空值的22.5%,它们在任何一份按“字段为空”出的报告里都会被算成内容欠债,而其中没有一件需要写文案。
我之前在商品价格那一栏做过一次类似的清算,六条报警扣到最后一条都不剩。这次不一样:扣完还剩一大半,而且能指出确定的那部分在哪:
| 站点 | 真该补的件数 | 占该站商品 |
|---|---|---|
| parachutehome.com | 453 | 28.8% |
| ugreen.com | 363 | 27.2% |
| bollandbranch.com | 230 | 10.5% |
| brooklinen.com | 111 | 23.6% |
| framebridge.com | 99 | 41.4% |
| chubbiesshorts.com | 98 | 5.5% |
| awaytravel.com | 92 | 8.9% |
前七个站占了这1748件里的1446件,82.7%。剩下的散落在二十来个站上,每站几十件。
接口里是空的,页面上就一定没字吗?
这是整篇里唯一不能靠数据库回答的问题。字段为空只说明那一栏没存东西,不说明商品页上没有文案——很多主题把商品正文放在自定义字段里,前台照样渲染得好好的。
先说清楚这一节不是在查渲染。JS渲染那三件担心的事和首页是不是空壳我都单独量过,那两次问的是“机器读不读得到”。这次问的是另一件事:数据库里那个空,和页面上那段字,到底是不是同一件事的两面。
按schema.org对description属性的定义,商品页的结构化数据里也有一个描述位。这个位置比接口更接近搜索引擎实际读到的东西,所以我拿它当尺子:用真实浏览器打开商品页,等渲染完成,把JSON-LD里Product节点的description取出来,再取一份页面的meta描述,跟接口值三方对照。
158个页面打开了151个。其中接口描述为空的有41个,非空的110个,正好构成一组同批同法的对照。
接口说空的,一多半页面上也是真的空
| 接口描述为空的41个页面 | 页数 | 占比 |
|---|---|---|
| 结构化数据和meta描述都是空的 | 24 | 58.5% |
| 只有meta描述有内容 | 15 | 36.6% |
| 结构化数据和meta都有内容 | 2 | 4.9% |
作为对照,接口描述非空的110个页面里,87.3%的结构化数据有描述,93.6%的meta有描述。两组差得非常干净:接口有的,页面上九成也有;接口没有的,页面上近六成也真的没有。
这个结果推翻了我开工时的假设。我原本以为“字段为空只是描述换了个地方存”会是主要情况,实测下来它只占4.9%。那24个三处都空的页面,是货真价实的没有商品说明——用户打开看到的只有标题、图片、价格和一排尺码。
前面挂起来的那个问题,这里可以回答了:marinelayer抽到的两件空值商品,页面上的结构化数据和meta描述同样是空的。它不属于“描述换个地方存”,它属于第二种——整站就不写商品描述。那2542件不是口径问题,是2542个只有图和价格的商品页。
这一步没做之前,我差点把这2542件当成误报扣掉。“站级空率高就是架构选择”这个判断听起来很合理,但它只是一个假设,需要有人去页面上验一次。验完发现,最像误报的那一档,恰恰是全样本里最扎实的一块真缺失。
把账重新算一遍
待定那批落地了,最终的账是这样:
| 口径 | 件数 | 占43912件 |
|---|---|---|
| 字段为空(最初的读数) | 5537 | 12.6% |
| 确认不该算的(非商品、半成品、占位) | 1247 | 2.8% |
| 本该有描述而没有 | 4290 | 9.8% |
| 其中:一个站的整站决策 | 2542 | 5.8% |
| 其中:其余站的零散漏填 | 1748 | 4.0% |
三个数字,三种用途。12.6%不能用,它把不是货的东西也算成了欠债。9.8%是这批站真实的内容缺口。而如果你要给内容团队派工单,该看的是最后那一行——把marinelayer这种整站策略问题剥出去之后,其余站的漏填率是1748件除以41356件,4.2%。
这三个数落在同一批数据上,谁也没算错。区别在于问题问得对不对:字段状态、内容缺口、可派工的活,本来就是三件事。
中间那36.6%才是真正需要小心的一档
只有meta描述有内容的那15个页面,情况介于两者之间:主题拿别的字段(通常是标题加类目,或者一段站点通用文案)给meta兜了个底。这一段能进搜索结果的摘要,但它不是商品描述,几乎不携带这件商品独有的信息。
换句话说,这15个页面在任何“meta描述覆盖率”的检查里都会显示为合格,可它们和那24个真空页面的实际内容量是一个水平。拿覆盖率当尺子的第二个坑就在这儿——上一个坑是把不该算的算进来,这个坑是把该算的漏出去。
顺手量到的另一件事:填了也未必全都进去
接口描述非空、且结构化数据里也有描述的页面有96个。把两边的字符数对一遍:只有10个页面长度基本一致,85个页面结构化数据里那段明显更短。
主题在往结构化数据里写description的时候做了截断,通常截到一两百字符。这不算错——Google对摘要长度本来就有实际限制——但它意味着一件事:你写的那八百字商品文案,进结构化数据的只有开头一小段。如果重要信息写在第三段,它在这条通道上是不存在的。
还是要说清楚抽样的边界。每个站取四件,只够判断“这个站属于哪一类”,不够估计任何一个站内部的比例。上面所有百分比的分母都是页面数,不是商品数;前面几节涉及商品比例的结论,全部来自43912件的全量接口数据,没有用这批抽样。
缺描述的商品,是不是别的地方也缺?
为了避开两头极端站的干扰,这一节只看空率在2%到60%之间的那27个站,在同一批站内部做对比——同站比同站,不跨站比。
| 指标 | 描述为空的商品 | 有描述的商品 |
|---|---|---|
| 件数 | 2783 | 10321 |
| 一张图都没有 | 7.0% | 2.7% |
| 一个标签都没有 | 8.9% | 1.9% |
| 类目也是空的 | 33.6% | 28.0% |
| 图片数中位 | 3 | 5 |
| 标签数中位 | 6 | 11 |
| 变体数中位 | 1 | 2 |
六项全部同向。没有描述的商品,图更少、标签更少、变体更少。它不是一个字段漏了,是这件货整体被冷落了——建档的时候就没人认真对待过它。
这个结论把处理方式又改了一次:如果你打算按缺描述这条线去补,那么补的时候顺手把图和标签一起看了,返工成本比分三轮跑低得多。反过来,这也意味着单靠“描述是否为空”这一个信号,就能相当准地圈出一批被冷落的商品——它比人工挑选省事。
新上架的商品反而更容易没描述
还是这27个站,按商品的建档年份分组:
| 建档年份 | 空描述 | 有描述 | 空占比 |
|---|---|---|---|
| 2026 | 1032 | 3537 | 22.6% |
| 2025 | 1350 | 4158 | 24.5% |
| 2024 | 301 | 1754 | 14.6% |
| 2023 | 42 | 405 | 9.4% |
| 2022 | 17 | 202 | 7.8% |
越新越空。2025和2026建档的商品空描述率是22%到24%,2022和2023只有8%到9%,差了近3倍。
这跟直觉是反的——直觉说老货才会被遗忘。但老货是熬过来的:它们经历过完整的上架流程,也经历过后来每一轮内容整理;新货还在流水线上,缺的那部分还没来得及补。我在按上架时间给43912件商品排队那次得到过同向的结论:sitemap收录和站内可达那两项,被漏掉的也不是老货,是新货。同一批数据,两个不相干的维度,指向同一件事。
顺带纠正一个常见的做法。内容审计通常从内容剪枝那一头切进去,先找旧的、找衰减的。放在商品库上,这个顺序会让你从最不缺的地方开始查。分类页那边的年份分布也是类似的形状:最老的那批反而最规矩,出问题的在中间和最近。
另一头:有人把整个落地页塞进了这一栏
说完空的,说满的。全样本里描述超过5000字符的有978件,集中在9个站,其中两个站几乎全员超标:
- ugreen.com:1336件商品里有814件超过5000字符,占60.9%,该站描述长度中位数7067;
- baseus.com:218件里147件超标,占67.4%,中位数7853。
作为对照,全样本有描述的38375件,长度中位数是462字符。最长的一条55238字符——一条商品描述,抵得上一篇中等长度的白皮书。
这两个站不是文案写得比别人勤快十五倍,是把整个商品落地页——版式、表格、样式、参数矩阵——全塞进了这个字段。它现在同时是内容容器和页面构建器。HTML体积过大导致商品链接被截断这件事,源头往往就在这儿;而把这么长一段折进标签页之后,用户能不能读到又是另一笔账。
字段被挪作他用这件事,在商品数据里不是孤例。条码栏里填变体ID的后八位是一种,品牌栏里填着开发环境的名字是另一种——那一篇量的是同一批43912件商品的另一栏,结论正好反过来:那一栏一件没空,可填进去的东西同样不能直接用。空和满是同一个毛病的两面,这个字段没人定过规矩。
把空的和满的放在一起看,这一节才有意义:一个站全不用它,两个站拿它当页面构建器,中间的站按它本来的用途填一段文案——三种用法并存,说明这个字段从来没有过一个约定。而所有跨站的“描述覆盖率”统计,都默认了这个约定存在。
这一栏到底该由谁负责填?
数据到这里就说完了,剩下是怎么处理。前面那些百分比之所以难看,根子不在文案能力,在于没人认领这个字段。
商品描述横跨三个岗位:运营建档的时候要填一版,内容团队后来要润色一版,投放那边还要一版符合购物数据规范的。三方都写过,三方都不认为自己是最终责任人,于是新品上架时那一栏最容易被跳过——反正后面还有人补。而“后面那个人”是谁,多数团队没写在任何文档里。
保哥见过一个五百多SKU的家居站,情况和上表里的parachutehome很像:新品空描述率接近三成,老品几乎不空。翻工单记录才发现,2024年之前上新走的是内容团队排期,之后为了提速改成运营直接建档、内容团队每周回补,而那个每周回补的动作在半年前的一次人员交接里丢了,没人发现,因为没有任何一个报表在盯这个数。补完之后他们做的第一件事不是写文案,是给上架流程加了一道卡口:描述为空的商品不允许进入待发布队列。
自己的站怎么把这笔账算准?
七步,顺序不能乱。中间那几步都是在往下扣,扣完才知道该派多少工。
- 先按站或按品类分组算,别先算总数。如果你管着多个站或多条产品线,总数没有意义。分组之后把空率超过90%的那一组单拎出来先放着,它的性质要等第五步才能定——千万别在这一步就当架构问题扣掉,本文最大的一次差点出错就在这儿。
- 把非商品条目扣掉。运费险、延保、礼品卡、面料小样、赠品、订阅计划、碳中和抵扣。用类目和地址里的关键词扫一遍就能圈出绝大部分,本次样本里这一类占了全部商品的5.23%、占空描述的18.1%。
- 把占位和测试条目扣掉。地址里带spacer、placeholder、test、dummy、copy-of、temp的。数量通常不多,但留着会污染后面每一个百分比。
- 把整条都空的记录单拎出来。描述、类目、标签同时为空的,那是建档没完成,该退回给建档流程,不是派给写文案的人。
- 用浏览器给每一组抽验前台。每组取一件空值商品和一件有描述的商品打开页面,看结构化数据里的description和meta描述有没有内容。这一步是给第一步收尾的:页面上有字,那一组是存储位置问题;页面上也没字,那一组就是实打实的缺内容。本次样本里那个99.5%的站,就是在这一步从“待定”变成了“真缺”,2542件全部回到工单里。
- 剩下的排成工单。按站或按品类排序,你会发现它高度集中——本次样本里除去那个整站问题,其余的漏填有八成挤在7个站上。
- 给上架流程加卡口,别指望回补。新品空率高于老品这件事,本身就说明回补机制不可靠。把校验放在发布前,比放在报表里有用得多。
最后提一句排序。这些商品真要补的时候,别按字母序也别按建档时间序——先看哪些商品从首页点得到,从有流量入口的那批开始补,比从头补一遍的回报快得多。
常见问题解答
商品描述为空,Google会不会直接不收录这个页面?
不会直接不收录。一个只有标题、图片和价格的商品页照样能进索引,也能出现在搜索结果里。真正的损失在别处:这一段文案通常是整个商品页上唯一属于你自己的原创内容,缺了它,页面剩下的东西——参数、价格、图片——在同品类的成百上千个页面里高度雷同。Google生成搜索摘要时也会优先从页面正文取材,没有正文就只能拿别的凑。
那接口里没有、页面上有,算不算问题?
不算问题,但算一个必须记录在案的口径差。它的直接后果是:任何基于商品导出或者接口做的内容审计,在这个站上都会给出一个虚高的缺失率。真正需要警惕的是反过来的情况——接口里有、页面上没有,那说明主题没渲染这一段,用户和搜索引擎都看不到,那才是真丢了。
礼品卡、运费险这类条目,要不要写描述?
面向用户的那一句要写,面向SEO的那一段不用。这类条目的价值在结算流程里,不在搜索里。更该做的是别让它们进sitemap、别让它们出现在分类页的商品数统计里,也别让它们参与你的内容覆盖率计算。本次样本里它们占了全部商品的5.23%,比例不大,但足以让一份报告的结论偏掉一档。
为什么新品的空描述率反而比老品高?
因为老品是筛选后的幸存者。它们走完了完整的上架流程,还经历了之后每一轮内容整理和批量补齐;新品还在流程中间,缺的部分尚未被任何一轮回补动作覆盖。这个规律有个直接用处:内容审计不该只盯着陈旧页面,最近三到六个月新建的商品才是缺口最集中的地方。
把整个页面塞进描述字段,除了体积还有什么坏处?
三个。一是这段内容会被原样带进结构化数据和商品数据源,带着表格和样式,下游解析容易出错;二是它绑死了平台,换主题或者迁站的时候这批内容基本没法复用;三是同一份文案在页面上和数据源里各有一份副本,改一处另一处不跟,时间一长必然对不上。真正需要复杂版式的商品,用页面模块搭,别用这一个字段扛。
用无头浏览器抽验,抽多少件才够?
先按站抽,每站至少一件空值商品加一件有描述的商品做对照,这一步是判断这个站属于哪一类,不是估比例。确认了类型之后,只有需要估比例的那几个站才值得加量,每站三十件起。本文用的是每站四件的量级,够回答“这个站属于哪一类”——把那2542件从待定改判成真缺,靠的正是这一层;不够回答“这个站有百分之几”,所以正文里所有的比例,分母都是43912件的全量接口数据,没有一个是从这批抽样外推的。
这批数字能直接拿去跟自己的站比吗?
比例不能,方法能。样本是56个跑在同一个电商平台上的英文独立站,品类偏服饰、家居和户外,多数是自营品牌。换平台字段语义就变了,换品类非商品条目的比例也会变。可以直接拿走的是那套四步扣减法和判据顺序,比例请在自己的库上重算。
权威参考资料
本文标题:《商品描述空了5537件,其中2542件出自同一个站》
本文链接:https://zhangwenbao.com/product-description-empty-field-attribution-audit.html
版权声明:本文原创,转载与引用请注明作者与原文链接。许可协议: CC BY 4.0
← 上一篇
商品品牌字段一个空的都没有,17个站把自己写成了好几个牌子下一篇 →
没有了