百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

最新《字体反爬策略及理论分析》

zhezhongyun 2025-04-29 06:46 2 浏览

#python爬虫#

CSS3时代,开发者使用@font-face为网页指定字体,就不必依赖计算机字体。在爬虫的过程中,就有了下面这种情况:

这里评分、评论人数、票房的网页源码为乱码。


1、字体加载原理

我们访问页面的时候,源代码会有以下类似的代码:

这里的src: url()括号里面就是字体下载的地址,有兼容多种浏览器的版本的url,我们通常用format('woff')的那个即可。把这个url拷贝到浏览器的地址栏中即可下载。

我们也可以通过浏览器的调试工具查看加载过程,会在Network--Font选项卡中看到:

下载好字体后,利用fontLab打开即可看到“字形码””对应的真正的数值“。这两个概念稍后会细说。


2、解决方法

我们爬虫抓取到的文本内容直接打印肯定会出现乱码,因为我们电脑上没有别人自定义的新字体。

第一步需要利用fontLab人工构建字形码:真正的数值的字典映射。

第二步通过这些乱码推导出字形编码,['uni' + '%x'.upper() % ord(i) for i in char_raw],即将每个字符转为16进制显示可得到字形码。之后利用上方的字典即可得到真正的数值。

通过css选择器获取乱码文本

之后再调用下图获取真正数字的函数即可

多数情况下网站就一套字体,毕竟制作字体的成本也较高,可以通过上方思路解决。当然,如果网站有多套字体就比较麻烦了,你可以说我每套字体都下载下来人工映射没问题。

关于多种字体的破解问题,以前是字形对象没有变,字形编码会变;现在是两者都变。所以利用字形对象相等的原理已经不行了。所以解决方法无非机器学习或者网上付费自动识别的api了。

下方简单介绍了字体、字形的概念,以及破解的难处。


3、字体背后的细节问题

(1)WOFF(Web Open Font Format,Web 开放字体格式)是一种网页所采用的字体格式标准。字体中的每个字形由网格上的一系列点展示出来,点是字体中的最小单位。

字体文件中不仅包含字形数据和点信息,还包括字符到字形映射、字体标题、命名和水平指标等,这些信息存在对应的表中。

这里通过Python的三方库,pip install fonttools,将字体存储为xml文件,打开后即可看到字体的详细信息。

from fontTools.ttLib import TTFont

font = TTFont('9fc50aa7.woff')

font.saveXML('movie.xml')

图中x和y即为点的坐标,这么多点构成了我们看到的字形。


(2)破解难处

以前我们可以比较字体对象是否相等来判断是否是同一个字,现在较难。

比如这个“6”,

第一: 每套字体同样是“6”,但点的个数不同;

第二: 还有可能是点的坐标会发生偏移。

下方这个图展示的是,不同字体对应相同字形的点的个数,蓝色线就是相同字形的点的差异:

下方这个图是,具体字形在fontLab中显示的点的对比(右边的3比左边的多了两个点):

同一个字形,点的坐标发生偏移,见下图:

以上就是全部内容了!

相关推荐

JPA实体类注解,看这篇就全会了

基本注解@Entity标注于实体类声明语句之前,指出该Java类为实体类,将映射到指定的数据库表。name(可选):实体名称。缺省为实体类的非限定名称。该名称用于引用查询中的实体。不与@Tab...

Dify教程02 - Dify+Deepseek零代码赋能,普通人也能开发AI应用

开始今天的教程之前,先解决昨天遇到的一个问题,docker安装Dify的时候有个报错,进入Dify面板的时候会出现“InternalServerError”的提示,log日志报错:S3_USE_A...

用离散标记重塑人体姿态:VQ-VAE实现关键点组合关系编码

在人体姿态估计领域,传统方法通常将关键点作为基本处理单元,这些关键点在人体骨架结构上代表关节位置(如肘部、膝盖和头部)的空间坐标。现有模型对这些关键点的预测主要采用两种范式:直接通过坐标回归或间接通过...

B 客户端流RPC (clientstream Client Stream)

客户端编写一系列消息并将其发送到服务器,同样使用提供的流。一旦客户端写完消息,它就等待服务器读取消息并返回响应gRPC再次保证了单个RPC调用中的消息排序在客户端流RPC模式中,客户端会发送多个请...

我的模型我做主02——训练自己的大模型:简易入门指南

模型训练往往需要较高的配置,为了满足友友们的好奇心,这里我们不要内存,不要gpu,用最简单的方式,让大家感受一下什么是模型训练。基于你的硬件配置,我们可以设计一个完全在CPU上运行的简易模型训练方案。...

开源项目MessageNest打造个性化消息推送平台多种通知方式

今天介绍一个开源项目,MessageNest-可以打造个性化消息推送平台,整合邮件、钉钉、企业微信等多种通知方式。定制你的消息,让通知方式更灵活多样。开源地址:https://github.c...

使用投机规则API加快页面加载速度

当今的网络用户要求快速导航,从一个页面移动到另一个页面时应尽量减少延迟。投机规则应用程序接口(SpeculationRulesAPI)的出现改变了网络应用程序接口(WebAPI)领域的游戏规则。...

JSONP安全攻防技术

关于JSONPJSONP全称是JSONwithPadding,是基于JSON格式的为解决跨域请求资源而产生的解决方案。它的基本原理是利用HTML的元素标签,远程调用JSON文件来实现数据传递。如果...

大数据Doris(六):编译 Doris遇到的问题

编译Doris遇到的问题一、js_generator.cc:(.text+0xfc3c):undefinedreferenceto`well_known_types_js’查找Doris...

网页内嵌PDF获取的办法

最近女王大人为了通过某认证考试,交了2000RMB,官方居然没有给线下教材资料,直接给的是在线教材,教材是PDF的但是是内嵌在网页内,可惜却没有给具体的PDF地址,无法下载,看到女王大人一点点的截图保...

印度女孩被邻居家客人性骚扰,父亲上门警告,反被围殴致死

微信的规则进行了调整希望大家看完故事多点“在看”,喜欢的话也点个分享和赞这样事儿君的推送才能继续出现在你的订阅列表里才能继续跟大家分享每个开怀大笑或拍案惊奇的好故事啦~话说只要稍微关注新闻的人,应该...

下周重要财经数据日程一览 (1229-0103)

下周焦点全球制造业PMI美国消费者信心指数美国首申失业救济人数值得注意的是,下周一希腊还将举行第三轮总统选举需要谷歌日历同步及部分智能手机(安卓,iPhone)同步日历功能的朋友请点击此链接,数据公布...

PyTorch 深度学习实战(38):注意力机制全面解析

在上一篇文章中,我们探讨了分布式训练实战。本文将深入解析注意力机制的完整发展历程,从最初的Seq2Seq模型到革命性的Transformer架构。我们将使用PyTorch实现2个关键阶段的注意力机制变...

聊聊Spring AI的EmbeddingModel

序本文主要研究一下SpringAI的EmbeddingModelEmbeddingModelspring-ai-core/src/main/java/org/springframework/ai/e...

前端分享-少年了解过iframe么

iframe就像是HTML的「内嵌画布」,允许在页面中加载独立网页,如同在画布上叠加另一幅动态画卷。核心特性包括:独立上下文:每个iframe都拥有独立的DOM/CSS/JS环境(类似浏...