搜索

Python 教学

基本介绍

Python 学习导读 使用 Google Colab 使用 Anaconda 使用 Python 虚拟环境 Python 范例集锦

数据型别

变数 variable 变数 ( 全域、区域 ) 数字 number 文字与字串 string 文字与字串 ( 常用方法 ) 文字与字串 ( 格式化 ) 串列 list 串列 ( 常用方法 ) 元组/数组 tuple 字典 dictionary 集合 set

语法观念

缩排和注解 运算子 operator 逻辑判断 ( if、elif、else ) 逻辑判断 ( and 和 or ) 重复循环 ( for、while ) 例外处理 ( try、except ) 生成式 comprehension 对象类别 class 对象继承 inheritance 导入模组 import

函数操作

函数 function 匿名函数 lambda 递回 recursion 产生器 generator 装饰器 decorator 闭包 closure

内建函数&方法

输入与输出 数学计算 字串操作与转换 迭代对象转换 迭代对象操作 文件读写 ( open ) eval() 与 exec()

标准函数库&模组

随机数 random 数学 math 数学统计函数 statistics 时间与日期 datetime 时间处理 time 日历 calendar 使用正规表达式 re 文件操作 os 查找匹配文件 glob 压缩文件 zipfile 高阶文件操作 shutil 高效迭代器 itertools 容器数据型态 collections CSV 文件操作 JSON 文件操作 threading 多执行绪处理 concurrent.futures

网络爬虫

Python 网络爬虫导读 关于网络爬虫 破解反爬虫的方法 Requests 函数库 Beautiful Soup 函数库 Selenium 函数库 爬取 PTT 文章标题 自动下载 PTT 正妹图片 同时下载多张图片 同时下载多张宝可梦图片 爬取 CCTV 即时图像 爬取统一发票号码对奖 爬取空气质量指标 ( AQI ) 爬取气象预报 爬取现在天气 LINE Notify 雷达回波图 LINE Notify 即时地震信息 爬取台湾银行牌告汇率 爬取 Yahoo 股市即时股价 爬取 LINE TODAY 留言 批次下载 Pinterest 图片 登录 Mobile01 截图下载 Twitter 自动上传图文

网页服务与应用

Flask 函数库 使用 ngrok 服务 Google Cloud Functions 串接 Gmail 寄送电子邮件 读取 Google 试算表 写入 Google 试算表 上传 Google 云端硬盘 发送 LINE Notify 通知 使用 Dialogflow Dialogflow + Webhook 服务器串接 Dialogflow 串接 Firebase 数据库 (1) 串接 Firebase 数据库 (2) 串接 Firebase 数据库 (3) 使用 OpenAI ChatGPT ChatGPT + Firebase

LINE BOT 教学

LINE BOT 教学导读 ( 免程序 ) 建立 LINE 官方账号 ( 免程序 ) 主动推播消息 ( 免程序 ) 自动回复消息 ( 免程序 ) 建立图文选单 ( 免程序 ) 基本消息类型 建立 LINE Channel 设定 Colab 开发环境 建立并串接 Webhook 解析 LINE 的消息 自动回复消息 主动推播消息 建立图文选单 切换图文选单 发送样板消息 发送 Flex Message 使用 Requests 传送消息 使用 LINE URL Scheme 储存用户的图片或影片 串接 Email 传送图片或影片 串接 Google 云端硬盘 气象机器人 (1) 气象机器人 (2) 气象机器人 (3) 气象机器人 (4) 串接 Dialogflow (1) 串接 Dialogflow (2) 串接 Dialogflow (3) 串接 Dialogflow (4) 串接 OpenAI ChatGPT (1) 串接 OpenAI ChatGPT (2) 串接 OpenAI ChatGPT (3)

OpenCV 教学

OpenCV 教学导读 OpenCV 函数库 打开并显示图片 写入并储存图片 读取并播放影片 写入并储存影片 取得图像信息 旋转/翻转/改变尺寸 图像的几何变形 图像的色彩转换 绘制各种形状 图像加入文字 剪裁图像 调整对比和亮度 负片效果 图像模糊化 图像的叠加与相减 二值化黑白图像 图像的侵蚀与膨胀 图像边缘侦测 魔术棒填充颜色 图像遮罩 边缘羽化效果 马赛克效果 子母画面影片 万花筒影片效果 多画面延迟播放影片 搞笑全景影片合成效果 凸透镜效果 ( 鱼眼效果 ) 倒数计时自动拍照效果 线性渐层填色 合成半透明图片 将指定的颜色变透明 处理 gif 动画 影片转透明 gif 动画 辨识 QRCode 和 BarCode 扫描 QRCode 切换效果 侦测鼠标事件 鼠标选取自动马赛克 即时在影片中绘图 侦测键盘行为 加入滑杆 ( Trackbar ) 拍照上传 Google 云端硬盘

AI 图像辨识教学

AI 图像辨识教学导读 OpenCV 人脸侦测 OpenCV 人脸马赛克 OpenCV 五官侦测 OpenCV 汽车侦测 OpenCV 行人侦测 OpenCV 辨识不同人脸 OpenCV 单对象追踪 OpenCV 多对象追踪 OpenCV 抓取特定颜色 OpenCV 追踪并标记颜色 情绪辨识与年龄侦测 辨识微笑,拍照储存 使用 Mediapipe ( 新 ) Mediapipe 人脸侦测 ( 新 ) Mediapipe 人脸特征点侦测 ( 新 ) Mediapipe 手掌侦测 ( 新 ) 使用 Mediapipe ( 旧 ) Mediapipe 人脸侦测 ( 旧 ) Mediapipe 人脸网格 ( 旧 ) Mediapipe 手掌侦测 ( 旧 ) Mediapipe 姿势侦测 Mediapipe 全身侦测 Mediapipe 物体侦测 Mediapipe 人物去背 Mediapipe 手势辨识 辨识比中指,自动马赛克 用手指在影片中画图 手指擦除镜子雾气效果 即时合成搞笑橘子脸 Jupyter 安装 Tensorflow 使用 Teachable Machine 辨识剪刀、石头、布 辨识是否戴口罩 辨识手写数字

NumPy 教学

NumPy 教学导读 NumPy 函数库 数据型态 建立数组 读取数组 迭代数组 数组项目赋值 修改数组形状 修改数组项目 填充数组 分割数组 合并数组 数组排序 广播 搜索数组项目 算数计算 数学函数 随机数 字串操作处理

matplotlib 图表

matplotlib 教学导读 matplotlib 函数库 Figure 和 Axes Figure 参数设定 建立多个子图表 设定图表标签 设定座标轴位置 设定座标轴刻度文字 数据文字标记 加入颜色对照表 使用极座标系统 使用 3D 图表 图表显示中文 下载储存图表 显示图片 制作图表动画 ( 图表 ) 折线图 ( 图表 ) 散布图 ( 图表 ) 长条图 ( 图表 ) 圆饼图 ( 图表 ) 甜甜圈图 ( 图表 ) 等高线图 ( 图表 ) 阶梯折线图 ( 图表 ) 堆叠折线图 ( 图表 ) 堆叠长条图 ( 图表 ) 极座标长条图 ( 图表 ) 极座标散布图 ( 图表 ) 3D 柱状长条图 ( 图表 ) 3D 散布图

Tkinter 界面设计

建立 Tkinter 视窗 Label 标签 Button 按钮 Radiobutton 单选按钮 Checkbutton 复选按钮 Entry 单行输入框 Text 多行输入框 Listbox 列表选择框 OptionMenu 下拉选单 Scale 数值调整滑杆 Spinbox 数值调整元件 Frame 框架 LabelFrame 标签框架 Scrollbar 滚动条 Canvas 画布 Menu 选单 Messagebox 消息提示框 Photoimage 显示图片 ttk.Progressbar 进度条 ttk.Combobox 下拉选单 Pack 基本版面布局 Grid 格状版面布局 Place 位置版面布局 范例 - Label 制作时钟 范例 - 点击按钮开文件 范例 - 打开多个文件 范例 - 打开并压缩文件 范例 - 打开并显示图片 范例 - 调整图片亮度对比 范例 - 简单计算机 范例 - 发送 LINE Notify

PyQt5 界面设计

PyQt5 函数库 使用 Qt designer 建立 PyQt5 视窗 QLabel 标签 QPushButton 按钮 QRadioButton 单选按钮 QCheckBox 复选按钮 QGraphicsView 显示图片 QLineEdit 单行输入框 QTextEdit 多行输入框 QListWidget 列表选择框 QComboBox 下拉选单 QSpinBox 数值调整元件 QTimeEdit 时间调整元件 QDateEdit 日期调整元件 QSlider 数值调整滑杆 QProgressBar 进度条 QFileDialog 选择文件视窗 QMessageBox 对话视窗 QInputDialog 输入视窗 QMenuBar 视窗选单 QTimer 定时器 QThread 多执行绪 QtCore.pyqtSignal 信号传递 QtMultimedia 播放声音 QPainter 绘图 QPainter 绘图 ( QPen ) QPainter 绘图 ( 储存图片 ) QSS 样式设定 QWebEngineView 网页显示 Layout 布局 ( 垂直水平 ) Layout 布局 ( Grid 网格 ) Layout 布局 ( Form 表单 ) 侦测鼠标事件 侦测键盘与快速键组合 侦测与控制视窗 视窗中打开新视窗 显示图片的三种方法 显示 Matplotlib 图表 显示 Pillow 图片 显示 OpenCV 图片和影片 范例 - 世界时钟 范例 - 简单计算机 范例 - 储存文件为压缩档 范例 - 发送 LINE Notify 范例 - 电脑摄影机 范例 - 摄影机拍照录影 范例 - 简单录音机 范例 - 小画家 范例 - 打开图片转档储存 范例 - 调整图片亮度对比

PyQt6 界面设计

PyQt6 函数库 PyQt6 和 PyQt5 的差异 建立 PyQt6 视窗 QLabel 标签 QPushButton 按钮 QRadioButton 单选按钮 QCheckBox 复选按钮 QGraphicsView 显示图片 QLineEdit 单行输入框 QTextEdit 多行输入框 QListWidget 列表选择框 QComboBox 下拉选单 QSpinBox 数值调整元件 QTimeEdit 时间调整元件 QDateEdit 日期调整元件 QSlider 数值调整滑杆 QProgressBar 进度条 QFileDialog 选择文件视窗 QMessageBox 对话视窗 QInputDialog 输入视窗 QMenuBar 视窗选单 QTimer 定时器 QThread 多执行绪 QtCore.pyqtSignal 信号传递 QtMultimedia 播放声音 QPainter 绘图 QPainter 绘图 ( QPen ) QPainter 绘图 ( 储存图片 ) QSS 样式设定 QWebEngineView 网页显示 Layout 布局 ( 垂直水平 ) Layout 布局 ( Grid 网格 ) Layout 布局 ( Form 表单 ) 侦测鼠标事件 侦测键盘与快速键组合 侦测与控制视窗 视窗中打开新视窗 显示图片的三种方法 显示 Matplotlib 图表 显示 Pillow 图片 显示 OpenCV 图片和影片 范例 - 世界时钟 范例 - 简单计算机 范例 - 储存文件为压缩档 范例 - 发送 LINE Notify 范例 - 电脑摄影机 范例 - 摄影机拍照录影 范例 - 简单录音机 范例 - 小画家 范例 - 打开图片转档储存 范例 - 调整图片亮度对比

影音处理范例

批次图片转档 批次调整图片尺寸 调整图片亮度和对比 裁切与旋转图片 拼接多张图片 图片加上 logo 浮水印 图片加上文字浮水印 图片马赛克效果 图片模糊化 图片锐利化 读取与修改图片 Exif 图片转文字 ( OCR ) 读取声音信息、输出声音 声音剪辑与串接 声音音量调整 声音混合与反转 改变声音速度 播放声音 麦克风录音 合成音符声音 显示声波图形 影片转档 取出影片声音或加入声音 影片剪辑与合并 影片混合与排列显示 改变影片尺寸、旋转翻转 调整影片速度、倒转影片 调整影片亮度/对比/颜色 影片转 gif 动画 影片中加入文字 影片自动加上字幕 影片截图、图片转影片

实际应用范例

下载 Youtube 影片 下载 Youtube 清单影片 定时自动屏幕截图 LINE Notify 传送屏幕截图 建立 MJPEG 即时图像串流 批次重新命名文件 产生 QRCode 产生 BarCode 读取 PDF 内容 PDF 拆分/合并/插入/删除 读取 EXCEL 内容 写入数据到 EXCEL CSV 写入 EXCEL 读取电脑信息 侦测电脑屏幕分辨率 查询电脑对内对外 IP 查询网站 IP、ping IP 制作 MacOS app

基础范例

电费试算 摄氏/华氏转换 厘米/英寸换算 判断平年与闰年 找出不重复字元 找出中间的字元 去除中英文夹杂的空白 大乐透电脑选号 下载进度条 星号金字塔 数字金字塔 猜数字 ( 猜大猜小 ) 猜数字 ( 几 A 几 B ) 简单时钟 ( 世界时间 ) 计算 BMI 数值 计算年纪 ( 岁、月、天 ) 产生身份证字号 ( 随机 ) 检查身份证字号 统一发票对奖 罗马数字转换

数学范例

两个数字的四则运算 计算多个数字的总和 费波那契数列 九九乘法表 质因数分解 快速找出质数 最小公倍数 ( 多个数字 ) 最大公因数 ( 多个数字 )

ZeroJudge 解答

关于 ZeroJudge a001: 哈啰 a002: 简易加法 a003: 两光法师占卜术 a004: 文文的求婚 a005: Eva 的回家作业 a006: 一元二次方程序 a009: 解码器 a010: 因数分解 a013: 罗马数字 a015: 矩阵的翻转 a017: 五则运算 a020: 身份证检验 a021: 大数运算 a022: 回文 a024: 最大公因数(GCD) a034: 二进位制转换 a038: 数字翻转 a040: 阿姆斯壮数 a042: 平面圆形切割 a044: 空间切割 a053: Sagit's 计分程序 a054: 电话客服中心 a058: MOD3 a059: 完全平方和 a065: 提款卡密码 a095: 麦哲伦的阴谋 a104: 排序 a147: Print it all a148: You Cannot Pass?! a149: 乘乘乐 a215: 明明爱数数 a216: 数数爱明明 a224: 明明爱明明 a225: 明明爱排列 a244: 新手训练~for+if a248: 新手训练~数组应用 a263: 日期差几天 a271: 彩色萝卜 a291: nAnB problem a410: 解方程 a414: 比特运算之进位篇 a417: 螺旋矩阵 a524: 手机之谜 a528: 大数排序 a647: 投资专家 a693: 吞食天地 a738: 最大公约数 a746: 画蛇添足 a799: 正值国 a915: 二维点排序 b265: Conformity b294: 经济大恐荒 b367: 翻转世界 b374: 求众数 b511: 换铜板 b558: 求数列第 n 项 e267: Group Reverse d073: 分组报告 d294: 算算算 Easy d485: 我爱偶数 d827: 买铅笔

Beautiful Soup 函数库

Beautiful Soup 函数库 ( 模组 ) 是一个 Python 外部函数库,可以分析网页的 HTML 与 XML 文件,并将分析的结果转换成“网页标签树”( tag ) 的型态,让数据读取方式更接近网页的操作语法,处理起来也更为便利,这篇教学会介绍 Beautiful Soup 函数库的基本用法。

快速导览:

本篇使用的 Python 版本为 3.7.12,所有范例可使用 Google Colab 实作,不用安装任何软件 ( 参考:使用 Google Colab )

安装 Beautiful Soup 模组

如果是使用 Colab 或 Anaconda,默认已经安装了 Beautiful Soup 函数库,不用额外安装,如果是本机环境,输入下列指令,就能安装 Beautiful Soup 函数库 ( 依据每个人的作业环境不同,可使用 pip 或 pip3 或 pipenv )。

pip install beautifulsoup4

import Beautiful Soup

要使用 Beautiful Soup 必须先 import Beautiful Soup 模组。

from bs4 import BeautifulSoup

开始使用 Beautiful Soup

将 HTML 的源代码 ( 纯文字 ) 提供给 Beautiful Soup,就能转换成可读取的标签树 ( tag ),所以通常会搭配 requests 爬取网页内容一并使用,下方的程序码执行后,会使用 requests 抓取“台湾水库即时水情 ”网页的源代码,接着使用 Beautiful Soup 转换成标签树,最后印出 title 的标签。

import requests
from bs4 import BeautifulSoup

url = 'https://water.taiwanstat.com/'
web = requests.get(url)                        # 取得網頁內容
soup = BeautifulSoup(web.text, "html.parser")  # 轉換成標籤樹
title = soup.title                             # 取得 title
print(title)                                   # 印出 title ( 台灣水庫即時水情 )

认识基本网页架构

使用 Beautiful Soup 时,会读取特定的网页结构 ( 如同上面的范例会从网页源代码里读取 title 的标签 ),因此必须要从网页源代码着手,稍微了解网页的架构,如果要观看源代码,可以用浏览器 ( Chrome ) 打开网页,用鼠标在网页的任意位置按下右键,点选“检视网页源代码”。

Python 教学 - Beautiful Soup 函数库 - 认识基本网页架构

点选后,会打开网页的源代码,这也是使用 requests 会读取到的基本数据。

Python 教学 - Beautiful Soup 函数库 - 打开网页的源代码

网页是由“标签”的语法所构成,标签 ( tag ) 指的是由“<”和“>”包覆的代码,通常没有斜线的“<标签>”作为开头,有斜线“</标签>”做为结尾,标签代码并不会显示在网页中,只有被标签包覆的内容才会显示在网页里,而标签也会互相层叠包覆,形成所为的“巢状结构”。

每个标签和所包覆的内容,会组合成一个 DOM ( 文件模型 ),网页的程序通常会针对 DOM 去做运算和处理,也可以针对不同的 DOM,给予不同的 id 或样式属性 ( attribute、class、style...等 ),只要知道 DOM 的标签,或是取得特定的 id、class 或 attribute,就能进一步透过程控 DOM。

下图是一个简单网页范例,左方的源代码会产生右方的网页内容,当中包含 h1、h2、div、ul、li...等标签。

Python 教学 - Beautiful Soup 函数库 - 左方的源代码会产生右方的网页内容

网页解析器

当借由 requests 取得网页源代码后,Beautiful Soup 还需要第二个“解析器”的参数,将源代码的“纯文字”,转换成可供分析取用的“标签树”,Python 本身内建“html.parser”的解析器,也可以使用下方指令,另外安装“html5lib”解析器 ( 依据每个人的作业环境不同,可使用 pip 或 pip3 或 pipenv )。

pip install html5lib

安装后,只要更换第二个参数,就可以更换解析器,下方的程序码使用 html5lib 解析器 ( 不需要 import,安装后就可以使用 ),html5lib 的容错率比 html.parser 高,但解析速度比较慢。

import requests
from bs4 import BeautifulSoup

url = 'https://water.taiwanstat.com/'
web = requests.get(url)
# soup = BeautifulSoup(web.text, "html.parser")  # 使用 html.parser 解析器
soup = BeautifulSoup(web.text, "html5lib")       # 使用 html5lib 解析器
title = soup.title
print(title)

Beautiful Soup 的方法

下方列出 Beautiful Soup 寻找网页内容的方法,当中最常使用的是 find_all()、find() 和 select()。

方法 说明
select() 以 CSS 选择器的方式寻找指定的 tag。
find_all() 以所在的 tag 位置,寻找内容里所有指定的 tag。
find() 以所在的 tag 位置,寻找第一个找到的 tag。
find_parents()、find_parent() 以所在的 tag 位置,寻找父层所有指定的 tag 或第一个找到的 tag。
find_next_siblings()、find_next_sibling() 以所在的 tag 位置,寻找同一层后方所有指定的 tag 或第一个找到的 tag。
find_previous_siblings()、ind_previous_sibling() 以所在的 tag 位置,寻找同一层前方所有指定的 tag 或第一个找到的 tag。
find_all_next()、find_next() 以所在的 tag 位置,寻找后方内容里所有指定的 tag 或第一个找到的 tag。
find_all_previous()、find_previous() 所在的 tag 位置,寻找前方内容里所有指定的 tag 或第一个找到的 tag。

下方的程序码,使用 Beautiful Soup 取得范例网页中指定 tag 的内容。

范例网页:https://www.iana.org/domains/

import requests
from bs4 import BeautifulSoup

url = 'https://www.iana.org/domains/'
web = requests.get(url)
soup = BeautifulSoup(web.text, "html.parser")

print(soup.select('#logo'))            # 搜尋 id 為 logo 的 tag 內容
print('\n----------\n')

print(soup.find_all('div',id="logo"))  # 搜尋所有 id 為 logo 的 div
print('\n----------\n')

divs = soup.find_all('div')            # 搜尋所有的 div
print(divs[1])                         # 取得搜尋到的第二個項目 ( 第一個為 divs[0] )
print('\n----------\n')

# 從搜尋到的項目裡,尋找父節點裡所有的 li
print(divs[1].find_parent().find_all('li'))
print('\n----------\n')

# 從搜尋到的項目裡,尋找父節點裡所有 li 的第三個項目,找到他後方同層的所有 li
print(divs[1].find_parent().find_all('li')[2].find_next_siblings())
print('\n----------\n')

# 從搜尋到的項目裡,尋找父節點裡所有 li 的第三個項目,找到他前方同層的所有 li
print(divs[1].find_parent().find_all('li')[2].find_previous_siblings())

Python 教学 - Beautiful Soup 函数库 - Beautiful Soup 的方法

由于 find_all() 是使用频率最高的方法,所以也可以简化成下列的写法:

import requests
from bs4 import BeautifulSoup

url = 'https://www.iana.org/domains/'
web = requests.get(url)
soup = BeautifulSoup(web.text, "html.parser")

print(soup.find_all('a'))    # 等同於下方的 soup('a')
print(soup('a'))             # 等同於上方的 find_all('a')

Beautiful Soup 方法的参数

使用 Beautiful Soup 方法时,可以加入一些参数,帮助更近一步的筛选搜索结果,下方是一些常用的参数:

参数 说明
string 搜索 tag 包含的文字。
limit 搜索 tag 后只回传多少个结果。
recursive 默认 True,会搜索内容所有层,设定 False 只会搜索下一层。
id 搜索 tag 的 id。
class_ 搜索 tag class,因为 class 为 Python 保留字,所以后方要加上底线。
href 搜索 tag href。
attrs 搜索 tag attribute 属性。

下方的程序码,使用 Beautiful Soup 取得范例网页中指定 tag 的内容,并加入参数做进一步的筛选。

范例网页:https://www.iana.org/domains/

import requests
from bs4 import BeautifulSoup

url = 'https://www.iana.org/domains/'
web = requests.get(url)
soup = BeautifulSoup(web.text, "html.parser")
print(soup.find_all('a'))                     # 找出所有 a tag
print(soup.find_all('a', string='Domains'))   # 找出內容字串為 Domains 的 a tag
print(soup('a', limit=2))                     # 找出前兩個 a tag

取得并输出内容

抓取到内容后,可以使用下列两种常用的方法,将内容或属性输出为字串:

方法 说明
.get_text() 输出 tag 的内容。
[属性] 输出 tag 里某个属性的内容。

下方的程序码执行后,会先输出第一个 a tag 的内容,接着输出第一个 a tag 里 href 属性的内容。

import requests
from bs4 import BeautifulSoup

url = 'https://www.iana.org/domains/'
web = requests.get(url)
soup = BeautifulSoup(web.text, "html.parser")
print(soup.find('a').get_text())   # 輸出第一個 a tag 的內容
print(soup.find('a')['href'])      # 輸出第一個 a tag 的 href 屬性內容

抓取水库的容量

如果是“静态”页面 ( 不需要跟服务器沟通、页面内容不是动态产生 ),透过 Beautiful Soup 都能很轻松的抓取到对应的内容,抓取到内容后,将内容输出为纯文字。

下方的程序码执行后,会抓取水库的名称以及最大容量 ( 因即时水位是动态产生,所以单纯用这个方法读取 )。

范例网页:https://water.taiwanstat.com/

import requests
from bs4 import BeautifulSoup

url = 'https://water.taiwanstat.com/'
web = requests.get(url)
soup = BeautifulSoup(web.text, "html.parser")
reservoir = soup.select('.reservoir')     # 取得所有 class 為 reservoir 的 tag
for i in reservoir:
  print(i.find('div', class_='name').get_text(), end=' ')  # 取得內容的 class 為 name 的 div 文字
  print(i.find('h5').get_text(), end=' ')   # 取得內容 h5 tag 的文字
  print()

Python 教学 - Beautiful Soup 函数库

参考数据

更多内容可以参考 Beautiful Soup 的官方网站说明:

意见反馈

微信二维码 微信扫码关注 抖音二维码 抖音扫码关注