Flying Bulldog

调用“抱抱脸团队打造的Transformers pipeline API” && 通过预训练模型，快速训练和微调自己的模型

本文章根据官方文件总结而成，根据第三方库Transformers and pytorch快速搭建自己的神经网络架构，可以直接下载预训练模型，涉及的数据集包括音频、文字、图像等，实用性非常强！

官方链接直达：GitHub - huggingface/transformers: Transformers: State-of-the-art Machine Learning for Pytorch, TensorFlow, and JAX.https://github.com/huggingface/transformers抱抱脸官方数据集网站，可以直接看到内容，链接直达：Hugging Face – The AI community building the future.https://huggingface.co/datasets

一、Torch官方下载

二、Transformers以及相关包的安装

三、预处理（调用Transformers API）

（1）文本预处理

（2）音频预处理

（3）图像预处理

（4）多模式任务

四、训练与微调

（1）使用 Transformers Trainer 微调预训练模型。

（2）在原生 PyTorch 中微调预训练模型。

一、Torch官方下载

链接直达：Previous PyTorch Versions | PyTorchhttps://pytorch.org/get-started/previous-versions/

进入官网后，根据电脑支持的CUDA版本，下载对应的torch版本，仅仅需要一行代码：

# CUDA==11.3 Window
conda install pytorch==1.10.1 torchvision==0.11.2 torchaudio==0.10.1 cudatoolkit=11.3 -c pytorch -c conda-forge

二、Transformers以及相关包的安装

pip install transformers # 变形金刚

pip install soundfile # 音频库

pip install librosa # 音频处理

pip install datasets # 负责下载一些数据集

三、预处理（调用Transformers API）

此处预处理大致可以分三步走：

加载数据集
加载预训练模型
数据增强

注意：下载数据集和预训练模型，运行代码，后台自动下载压缩包，如果网络突然中断，需要重新下载，图像的数据集有的5GB左右，尽量保持网络流畅。

*****************************************总结全在代码的注释之中*****************************************

（1）文本预处理

处理单个句子：

import torch
from transformers import AutoModel, AutoTokenizer  # 调用Transformer API

# 自动从官网下载预训练模型
tokenizer = AutoTokenizer.from_pretrained("bert-base-cased")

# ======================================================================================== #
# input_ids: 是对应于句子中每个标记的索引。 [101, 7769, 9255, 14082, 102]
# token_type_ids: 当有多个序列时，辨认出属于哪一个序列 [0, 0, 0, 0, 0]
# attention_mask: 表示是否应该被注意 [1, 1, 1, 1, 1]
encoded_input = tokenizer('Flying Bulldog')
print(encoded_input)  # 返回一个字典

# 如您所见，标记器在句子中添加了两个特殊标记 - CLS 和 SEP（分类器和分隔符）。
# 并非所有模型都需要特殊标记，但如果需要，标记器会自动为您添加它们。
decode_output = tokenizer.decode(encoded_input["input_ids"])
# CLS and SEP (classifier and separator)
print(decode_output)  # [CLS] Flying Bulldog [SEP]

处理多个句子：

import torch
from transformers import AutoModel, AutoTokenizer  # 调用Transformer API

# ======================================================================================= #
# 如果您要处理多个句子，请将这些句子作为列表传递给标记器：
batch_sentences = ["Flying Bulldog",
                   "Good Morning",
                   "Factory no smoking!"]
# 这给我们带来了一个重要的话题。 当你处理一批句子时，它们的长度并不总是相同的。
# 这是一个问题，因为作为模型输入的张量需要具有统一的形状。
# 填充是一种通过向具有较少标记的句子添加特殊填充标记来确保张量是矩形的策略。
# encoded_inputs = tokenizer(batch_sentences, padding=True)

# 另一方面，有时序列可能太长，模型无法处理。 在这种情况下，您需要将序列截断为更短的长度。
# truncation: 截断
# encoded_inputs = tokenizer(batch_sentences, padding=True, truncation=True)

# Finally, you want the tokenizer to return the actual tensors that are fed to the model.
# Set the return_tensors parameter to either pt for PyTorch, or tf for TensorFlow:
encoded_inputs = tokenizer(batch_sentences, padding=True, truncation=True, return_tensors="pt")
print(encoded_inputs)

for i in range(len(batch_sentences)):
    decode_outputs = tokenizer.decode(encoded_inputs["input_ids"][i])
    print(decode_outputs)

（2）音频预处理

补充：采样率（Sample Rate） 指一秒钟记录的音频点的数据量，通常用HZ（赫兹）来描述，比如44.1kHz表示1s中采样44100次。而音频的一个数据点就是一个数字，该数字如果用float类型表示的话，44.1kHz1s采样的数据就有44100个float数值。

"""
音频输入的预处理与文本输入不同，但最终目标保持不变：创建模型可以理解的数字序列。
特征提取器旨在从原始图像或音频数据中提取特征并将其转换为张量。
在开始之前，安装 Datasets 以加载音频数据集以进行试验：
"""
"""
在本教程中，您将使用 Wav2Vec2 模型。 从模型卡中可以看出，Wav2Vec2 模型是在 16kHz 采样语音音频上进行预训练的。
音频数据的采样率与用于预训练模型的数据集的采样率相匹配非常重要。 
如果您的数据的采样率不同，那么您需要重新采样您的音频数据。
"""

from datasets import load_dataset, Audio

# Load the MInDS-14 dataset  https://huggingface.co/docs/transformers/preprocessing
dataset = load_dataset("PolyAI/minds14", name="en-US", split="train")
print(dataset[0])
# array is the speech signal loaded - and potentially resampled - as a 1D array.
# path points to the location of the audio file.
# sampling_rate refers to how many data points in the speech signal are
print(dataset[0]["audio"])

# ============================================================ #
# 1. Use  Datasets’ cast_column method to upsample the sampling rate to 16kHz:
# 8KHZ >>> 16KHZ
dataset = dataset.cast_column("audio", Audio(sampling_rate=16_000))

# 2. Load the audio file:
file = dataset[0]["audio"]

# ============================================================ #
"""
下一步是加载一个特征提取器来规范化和填充输入。 填充文本数据时，为较短的序列添加 0。 
同样的想法适用于音频数据，音频特征提取器将向数组添加一个 0（解释为静音）。
"""
from transformers import AutoFeatureExtractor

feature_extractor = AutoFeatureExtractor.from_pretrained("facebook/wav2vec2-base")

audio_input = [dataset[0]["audio"]["array"]]
print(feature_extractor(audio_input, sampling_rate=16000))

# padding and truncation
def preprocess_function(examples):
    audio_arrays = [x["array"] for x in examples["audio"]]
    inputs = feature_extractor(
        audio_arrays,
        sampling_rate=16000,
        padding=True,
        max_length=100000,
        truncation=True,
    )
    return inputs

processed_dataset = preprocess_function(dataset[:5])

print(processed_dataset["input_values"][0].shape)
print(processed_dataset["input_values"][1].shape)

（3）图像预处理

"""
特征提取器还用于处理视觉任务的图像。 再一次，目标是将原始图像转换为一批张量作为输入。
让我们为本教程加载 food101 数据集。 使用 数据集拆分参数仅从训练拆分中加载一个小样本，因为数据集非常大：
"""
import cv2
import numpy
from datasets import load_dataset

# 下载数据集food101（5GB），选取前100张图像，作为预处理的数据
dataset = load_dataset("food101", split="train[:100]")

image_data = dataset[0]
print(image_data['image'])

# =============================================== #
from transformers import AutoFeatureExtractor

feature_extractor = AutoFeatureExtractor.from_pretrained("google/vit-base-patch16-224")

# # Data augmentation
# 标准化、随机选件角度、颜色跳动、最后转换成张量
from torchvision.transforms import Compose, Normalize, RandomResizedCrop, ColorJitter, ToTensor

normalize = Normalize(mean=feature_extractor.image_mean, std=feature_extractor.image_std)
_transforms = Compose(
    [RandomResizedCrop(feature_extractor.size),
     ColorJitter(brightness=0.5, hue=0.5),
     ToTensor(),
     normalize]
)

# 该模型接受 pixel_values 作为输入。 该值由特征提取器生成。 创建一个从变换生成 pixel_values 的函数：
def transforms(examples):
    examples["pixel_values"] = [_transforms(image.convert("RGB")) for image in examples["image"]]
    return examples

# 然后使用 Datasets set_transform 即时应用转换：
dataset.set_transform(transforms)

# 现在，当您访问图像时，您会注意到特征提取器已添加模型输入 pixel_values：
image_aug = dataset[0]["image"]
print(image_aug)

（4）多模式任务

"""
用于多模式任务。 您将结合迄今为止所学的所有知识，并将您的技能应用于自动语音识别 (ASR) 任务。这意味着您将需要：
1.用于预处理音频数据的特征提取器。
2.用于处理文本的标记器。
"""
from datasets import load_dataset

lj_speech = load_dataset("lj_speech", split="train")

lj_speech = lj_speech.map(remove_columns=["file", "id", "normalized_text"])

print(lj_speech[0]["audio"])
print(lj_speech[0]["text"])

# 请记住前面关于处理音频数据的部分，
# 您应该始终重新采样音频数据的采样率，以匹配用于预训练模型的数据集的采样率：
lj_speech = lj_speech.cast_column("audio", Audio(sampling_rate=16_000))

# ============================================================ #
# Processor
from transformers import AutoProcessor

processor = AutoProcessor.from_pretrained("facebook/wav2vec2-base-960h")

# 1. 创建一个函数以将音频数据处理为 input_values，并将文本标记为标签。 这些是您对模型的输入：
def prepare_dataset(example):
    audio = example["audio"]

    example["input_values"] = processor(audio["array"], sampling_rate=16000)

    with processor.as_target_processor():
        example["labels"] = processor(example["text"]).input_ids
    return example

# 2. Apply the prepare_dataset function to a sample:
prepare_dataset(lj_speech[0])

# 请注意，处理器添加了 input_values 和标签。 采样率也已正确下采样至 16kHz。

太棒了，您现在应该能够为任何模态预处理数据，甚至可以组合不同的模态！在下一个教程中，学习如何根据新预处理的数据微调模型。

四、训练与微调

官网给出了三种训练和微调的方式：

使用 Transformers Trainer 微调预训练模型。
使用 Keras 在 TensorFlow 中微调预训练模型。
在原生 PyTorch 中微调预训练模型。

注：本文章没有涉及Tensorflow，有兴趣的可以到官网自行查看。

（1）使用 Transformers Trainer 微调预训练模型。

"""
使用预训练模型有很多好处。 它降低了计算成本和碳足迹，并允许您使用最先进的模型，而无需从头开始训练。
  Transformers 为各种任务提供了对数千个预训练模型的访问。
 当您使用预训练模型时，您可以在特定于您的任务的数据集上对其进行训练。 这被称为微调，一种非常强大的训练技术。
在本教程中，您将使用您选择的深度学习框架微调预训练模型：
1.使用  Transformers Trainer 微调预训练模型。
2.使用 Keras 在 TensorFlow 中微调预训练模型。
3.在原生 PyTorch 中微调预训练模型。
"""
# =========================================================== #
# Begin by loading the Yelp Reviews dataset:
from datasets import load_dataset

dataset = load_dataset("yelp_review_full")
print(dataset["train"][100])

# =========================================================== #
# 分词器
from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("bert-base-cased")

# padding and truncation strategy
def tokenize_function(examples):
    return tokenizer(examples["text"], padding="max_length", truncation=True)

# 要一步处理您的数据集，请使用 Datasets map 方法对整个数据集应用预处理函数：
tokenized_datasets = dataset.map(tokenize_function, batched=True)

# =========================================================== #
# 如果您愿意，您可以创建完整数据集的较小子集以进行微调以减少所需时间：
small_train_dataset = tokenized_datasets["train"].shuffle(seed=42).select(range(1000))
small_eval_dataset = tokenized_datasets["test"].shuffle(seed=42).select(range(1000))

# =========================================================== #
# Transformers 提供了一个 Trainer 类，针对训练 Transformers 模型进行了优化，无需手动编写自己的训练循环即可更轻松地开始训练。
# Trainer API 支持广泛的训练选项和功能，例如日志记录、梯度累积和混合精度。
from transformers import AutoModelForSequenceClassification

model = AutoModelForSequenceClassification.from_pretrained("bert-base-cased", num_labels=5)
# 您将看到有关未使用某些预训练权重以及随机初始化某些权重的警告。 不用担心，这是完全正常的！
# BERT 模型的预训练头被丢弃，并替换为随机初始化的分类头。 您将在序列分类任务上微调这个新模型头，将预训练模型的知识传递给它。

# =========================================================== #
# 接下来，创建一个 TrainingArguments 类，其中包含您可以调整的所有超参数以及用于激活不同训练选项的标志。
# 对于本教程，您可以从默认的训练超参数开始，但可以随意尝试这些参数以找到您的最佳设置。
from transformers import TrainingArguments

# 指定从训练中保存检查点的位置：
training_args = TrainingArguments(output_dir="test_trainer")

# =========================================================== #
# METRIC
# Trainer 在训练期间不会自动评估模型性能。 您需要向 Trainer 传递一个函数来计算和报告指标。
#  Datasets 库提供了一个简单的精度函数，您可以使用 load_metric （请参阅本教程了解更多信息）函数加载：
import numpy as np
from datasets import load_metric

metric = load_metric("accuracy")

# 调用 compute on metric 来计算预测的准确性。
# 在将预测传递给计算之前，您需要将预测转换为 logits（记住所有 Transformers 模型都会返回 logits）：
def compute_metrics(eval_pred):
    logits, labels = eval_pred
    predictions = np.argmax(logits, axis=-1)
    return metric.compute(predictions=predictions, references=labels)

# 如果您想在微调期间监控评估指标，请在训练参数中指定评估策略参数以在每个 epoch 结束时报告评估指标：
from transformers import TrainingArguments, Trainer

training_args = TrainingArguments(output_dir="test_trainer", evaluation_strategy="epoch")

# =========================================================== #
# Create a Trainer object with your model, training arguments, training and test datasets, and evaluation function:
trainer = Trainer(
    model=model,
    args=training_args,
    train_dataset=small_train_dataset,
    eval_dataset=small_eval_dataset,
    compute_metrics=compute_metrics,
)

# Then fine-tune your model by calling train():
trainer.train()

# {'eval_loss': 1.2004259824752808, 'eval_accuracy': 0.484, 'eval_runtime': 18.4503, 'eval_samples_per_second': 54.2, 'eval_steps_per_second': 6.775, 'epoch': 3.0}
# {'train_runtime': 229.7662, 'train_samples_per_second': 13.057, 'train_steps_per_second': 1.632, 'train_loss': 1.3347870279947918, 'epoch': 3.0}

>>>运行结果图：

补充：下载的数据集的格式为arrow格式

数据格式：arrow 定义了一种在内存中表示tabular data的格式。这种格式特别为数据分析型操作（analytical operation）进行了优化。比如说列式格式（columnar format），能充分利用现代cpu的优势，进行向量化计算（vectorization）。不仅如此，Arrow还定义了IPC格式，序列化内存中的数据，进行网络传输，或者把数据以文件的方式持久化。
开发库：arrow定义的格式是与语言无关的，所以任何语言都能实现Arrow定义的格式。arrow项目为几乎所有的主流编程语言提供了SDK
下载部分文件如下：

（2）在原生 PyTorch 中微调预训练模型。

"""
Trainer 负责训练循环，并允许您在一行代码中微调模型。
对于喜欢编写自己的训练循环的用户，您还可以在原生 PyTorch 中微调 Transformers 模型。
"""
# =========================================================== #
# Begin by loading the Yelp Reviews dataset:
from datasets import load_dataset

dataset = load_dataset("yelp_review_full")
print(dataset["train"][100])

# =========================================================== #
# 分词器
from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("bert-base-cased")

# padding and truncation strategy
def tokenize_function(examples):
    return tokenizer(examples["text"], padding="max_length", truncation=True)

# 要一步处理您的数据集，请使用 Datasets map 方法对整个数据集应用预处理函数：
tokenized_datasets = dataset.map(tokenize_function, batched=True)

# =========================================================== #
# 1. Remove the text column because the model does not accept raw text as an input:
tokenized_datasets = tokenized_datasets.remove_columns(["text"])

# 2. 将标签列重命名为标签，因为模型需要将参数命名为标签：
tokenized_datasets = tokenized_datasets.rename_column("label", "labels")

# 3. 设置数据集的格式以返回 PyTorch 张量而不是列表：
tokenized_datasets.set_format("torch")

# =========================================================== #
# 然后创建一个较小的数据集子集，如前所示以加快微调：
small_train_dataset = tokenized_datasets["train"].shuffle(seed=42).select(range(1000))
small_eval_dataset = tokenized_datasets["test"].shuffle(seed=42).select(range(1000))

# =========================================================== #
# DataLoader
# 为您的训练和测试数据集创建一个 DataLoader，以便您可以迭代成批数据：
from torch.utils.data import DataLoader

train_dataloader = DataLoader(small_train_dataset, shuffle=True, batch_size=8)
eval_dataloader = DataLoader(small_eval_dataset, batch_size=8)

# 加载具有预期标签数量的模型：
from transformers import AutoModelForSequenceClassification  # 序列分类的自动模型

model = AutoModelForSequenceClassification.from_pretrained("bert-base-cased", num_labels=5)

# =========================================================== #
# 优化器和学习率调度器
# 创建一个优化器和学习率调度器来微调模型。 让我们使用 PyTorch 的 AdamW 优化器：
from torch.optim import AdamW

optimizer = AdamW(model.parameters(), lr=5e-5)

# 从 Trainer 创建默认学习率调度程序：
from transformers import get_scheduler

num_epochs = 3
num_training_steps = num_epochs * len(train_dataloader)
lr_scheduler = get_scheduler(
    name="linear", optimizer=optimizer, num_warmup_steps=0, num_training_steps=num_training_steps
)

# 最后，如果您有权使用 GPU，请指定使用 GPU 的设备。
# 否则，在 CPU 上的训练可能需要几个小时而不是几分钟。
import torch

device = torch.device("cuda") if torch.cuda.is_available() else torch.device("cpu")
model.to(device)

# =========================================================== #
# Great, now you are ready to train! 
# Training loop
# 要跟踪您的训练进度，请使用 tqdm 库在训练步骤数上添加进度条：
from tqdm.auto import tqdm  # 添加进度条

progress_bar = tqdm(range(num_training_steps))

model.train()
for epoch in range(num_epochs):
    for batch in train_dataloader:
        batch = {k: v.to(device) for k, v in batch.items()}
        outputs = model(**batch)
        loss = outputs.loss
        loss.backward()

        optimizer.step()
        lr_scheduler.step()
        optimizer.zero_grad()
        progress_bar.update(1)

# =========================================================== #
# Metrics（评价指标）
# 就像您需要向 Trainer 添加评估函数一样，您在编写自己的训练循环时也需要这样做。
# 但不是在每个 epoch 结束时计算和报告指标，这次您将使用 add_batch 累积所有批次并在最后计算指标。
from datasets import load_metric

metric = load_metric("accuracy")
model.eval()
for batch in eval_dataloader:
    batch = {k: v.to(device) for k, v in batch.items()}
    with torch.no_grad():
        outputs = model(**batch)

    logits = outputs.logits
    predictions = torch.argmax(logits, dim=-1)
    metric.add_batch(predictions=predictions, references=batch["labels"])

metric.compute()

>>>运行结果图：

>>> 如有疑问，欢迎评论区一起讨论

机器学习与深度学习间关系与区别 ℒℴѵℯ心·动ꦿ໊ོ꫞ 人工智能学习深度学习 python
一、机器学习概述定义机器学习（MachineLearning,ML）是一种通过数据驱动的方法，利用统计学和计算算法来训练模型，使计算机能够从数据中学习并自动进行预测或决策。机器学习通过分析大量数据样本，识别其中的模式和规律，从而对新的数据进行判断。其核心在于通过训练过程，让模型不断优化和提升其预测准确性。主要类型1.监督学习（SupervisedLearning）监督学习是指在训练数据集中包含输入
理解Gunicorn：Python WSGI服务器的基石范范0825 ipython linux 运维
理解Gunicorn：PythonWSGI服务器的基石介绍Gunicorn，全称GreenUnicorn，是一个为PythonWSGI（WebServerGatewayInterface）应用设计的高效、轻量级HTTP服务器。作为PythonWeb应用部署的常用工具，Gunicorn以其高性能和易用性著称。本文将介绍Gunicorn的基本概念、安装和配置，帮助初学者快速上手。1.什么是Gunico
如何在 Fork 的 GitHub 项目中保留自己的修改并同步上游更新？github_fork_update iBaoxing github
如何在Fork的GitHub项目中保留自己的修改并同步上游更新？在GitHub上Fork了一个项目后，你可能会对项目进行一些修改，同时原作者也在不断更新。如果想要在保留自己修改的基础上，同步原作者的最新更新，很多人会不知所措。本文将详细讲解如何在不丢失自己改动的情况下，将上游仓库的更新合并到自己的仓库中。问题描述假设你在GitHub上Fork了一个项目，并基于该项目做了一些修改，随后你发现原作者对
Python数据分析与可视化实战指南 William数据分析 python python 数据
在数据驱动的时代，Python因其简洁的语法、强大的库生态系统以及活跃的社区，成为了数据分析与可视化的首选语言。本文将通过一个详细的案例，带领大家学习如何使用Python进行数据分析，并通过可视化来直观呈现分析结果。一、环境准备1.1安装必要库在开始数据分析和可视化之前，我们需要安装一些常用的库。主要包括pandas、numpy、matplotlib和seaborn等。这些库分别用于数据处理、数学
python os.environ 江湖偌大 python 深度学习
os.environ['TF_CPP_MIN_LOG_LEVEL']='0'#默认值，输出所有信息os.environ['TF_CPP_MIN_LOG_LEVEL']='1'#屏蔽通知信息（INFO）os.environ['TF_CPP_MIN_LOG_LEVEL']='2'#屏蔽通知信息和警告信息（INFO\WARNING）os.environ['TF_CPP_MIN_LOG_LEVEL']='
Python中os.environ基本介绍及使用方法鹤冲天Pro #Python python 服务器开发语言
文章目录python中os.environos.environ简介os.environ进行环境变量的增删改查python中os.environ的使用详解1.简介2.key字段详解2.1常见key字段3.os.environ.get()用法4.环境变量的增删改查和判断是否存在4.1新增环境变量4.2更新环境变量4.3获取环境变量4.4删除环境变量4.5判断环境变量是否存在python中os.envi
Pyecharts数据可视化大屏：打造沉浸式数据分析体验我的运维人生信息可视化数据分析数据挖掘运维开发技术共享
Pyecharts数据可视化大屏：打造沉浸式数据分析体验在当今这个数据驱动的时代，如何将海量数据以直观、生动的方式展现出来，成为了数据分析师和企业决策者关注的焦点。Pyecharts，作为一款基于Python的开源数据可视化库，凭借其丰富的图表类型、灵活的配置选项以及高度的定制化能力，成为了构建数据可视化大屏的理想选择。本文将深入探讨如何利用Pyecharts打造数据可视化大屏，并通过实际代码案例
Python教程：一文了解使用Python处理XPath 旦莫 Python进阶 python 开发语言
目录1.环境准备1.1安装lxml1.2验证安装2.XPath基础2.1什么是XPath？2.2XPath语法2.3示例XML文档3.使用lxml解析XML3.1解析XML文档3.2查看解析结果4.XPath查询4.1基本路径查询4.2使用属性查询4.3查询多个节点5.XPath的高级用法5.1使用逻辑运算符5.2使用函数6.实战案例6.1从网页抓取数据6.1.1安装Requests库6.1.2代
python os.environ_python os.environ 读取和设置环境变量 weixin_39605414 python os.environ
>>>importos>>>os.environ.keys()['LC_NUMERIC','GOPATH','GOROOT','GOBIN','LESSOPEN','SSH_CLIENT','LOGNAME','USER','HOME','LC_PAPER','PATH','DISPLAY','LANG','TERM','SHELL','J2REDIR','LC_MONETARY','QT_QPA
将cmd中命令输出保存为txt文本文件落难Coder Windows cmd window
最近深度学习本地的训练中我们常常要在命令行中运行自己的代码，无可厚非，我们有必要保存我们的炼丹结果，但是复制命令行输出到txt是非常麻烦的，其实Windows下的命令行为我们提供了相应的操作。其基本的调用格式就是：运行指令>输出到的文件名称或者具体保存路径测试下，我打开cmd并且ping一下百度：pingwww.baidu.com>./data.txt看下相同目录下data.txt的输出：如果你再
下载github patch到本地小米人er 我的博客 git patch
以下是几种从GitHub上下载以.patch结尾的补丁文件的方法：通过浏览器直接下载打开包含该.patch文件的GitHub仓库。在仓库的文件列表中找到对应的.patch文件。点击该文件，浏览器会显示文件的内容，在页面的右上角通常会有一个“Raw”按钮，点击它可以获取原始文件内容。然后在浏览器中使用快捷键（如Ctrl+S或者Command+S）将原始文件保存到本地，选择保存的文件名并确保后缀为.p
509. 斐波那契数(每日一题) lzyprime
lzyprime博客(github)创建时间：2021.01.04qq及邮箱：2383518170leetcode笔记题目描述斐波那契数，通常用F(n)表示，形成的序列称为斐波那契数列。该数列由0和1开始，后面的每一项数字都是前面两项数字的和。也就是：F(0)=0，F(1)=1F(n)=F(n-1)+F(n-2)，其中n>1给你n，请计算F(n)。示例1：输入：2输出：1解释：F(2)=F(1)+
使用Faiss进行高效相似度搜索 llzwxh888 faiss python
在现代AI应用中，快速和高效的相似度搜索是至关重要的。Faiss（FacebookAISimilaritySearch）是一个专门用于快速相似度搜索和聚类的库，特别适用于高维向量。本文将介绍如何使用Faiss来进行相似度搜索，并结合Python代码演示其基本用法。什么是Faiss？Faiss是一个由FacebookAIResearch团队开发的开源库，主要用于高维向量的相似性搜索和聚类。Faiss
python是什么意思中文-在python中%是什么意思编程大乐趣
Python中%有两种：1、数值运算：%代表取模，返回除法的余数。如：>>>7%212、%操作符（字符串格式化，stringformatting），说明如下：%[(name)][flags][width].[precision]typecode(name)为命名flags可以有+，-，''或0。+表示右对齐。-表示左对齐。''为一个空格，表示在正数的左侧填充一个空格，从而与负数对齐。0表示使用0填
GitHub上克隆项目 bigbig猩猩 github
从GitHub上克隆项目是一个简单且直接的过程，它允许你将远程仓库中的项目复制到你的本地计算机上，以便进行进一步的开发、测试或学习。以下是一个详细的步骤指南，帮助你从GitHub上克隆项目。一、准备工作1.安装Git在克隆GitHub项目之前，你需要在你的计算机上安装Git工具。Git是一个开源的分布式版本控制系统，用于跟踪和管理代码变更。你可以从Git的官方网站（https://git-scm.
Day1笔记-Python简介&标识符和关键字&输入输出 ~在杰难逃~ Python python 开发语言大数据数据分析数据挖掘
大家好，从今天开始呢，杰哥开展一个新的专栏，当然，数据分析部分也会不定时更新的，这个新的专栏主要是讲解一些Python的基础语法和知识，帮助0基础的小伙伴入门和学习Python，感兴趣的小伙伴可以开始认真学习啦！一、Python简介【了解】1.计算机工作原理编程语言就是用来定义计算机程序的形式语言。我们通过编程语言来编写程序代码，再通过语言处理程序执行向计算机发送指令，让计算机完成对应的工作，编程
python八股文面试题分享及解析(1) Shawn________ python
#1.'''a=1b=2不用中间变量交换a和b'''#1.a=1b=2a,b=b,aprint(a)print(b)结果：21#2.ll=[]foriinrange(3):ll.append({'num':i})print(11)结果:#[{'num':0},{'num':1},{'num':2}]#3.kk=[]a={'num':0}foriinrange(3):#0,12#可变类型，不仅仅改变
git - Webhook让部署自动化大猪大猪
我们现在有一个需求，将项目打包上传到gitlab或者github后，程序能自动部署，不用手动地去服务器中进行项目更新并运行，如何做到？这里我们可以使用gitlab与github的挂钩，挂钩的原理就是，每当我们有请求到gitlab与github服务器时，这时他俩会根据我们配置的挂钩地扯进行访问，webhook挂钩程序会一直监听着某个端口请求，一但收到他们发过来的请求，这时就知道用户有请求提交了，这时
每日算法&面试题，大厂特训二十八天——第二十天（树）肥学 ⚡算法题⚡面试题每日精进 java 算法数据结构
目录标题导读算法特训二十八天面试题点击直接资料领取导读肥友们为了更好的去帮助新同学适应算法和面试题，最近我们开始进行专项突击一步一步来。上一期我们完成了动态规划二十一天现在我们进行下一项对各类算法进行二十八天的一个小总结。还在等什么快来一起肥学进行二十八天挑战吧！！特别介绍小白练手专栏，适合刚入手的新人欢迎订阅编程小白进阶python有趣练手项目里面包括了像《机器人尬聊》《恶搞程序》这样的有趣文章
Python快速入门 —— 第三节：类与对象孤华暗香 Python快速入门 python 开发语言
第三节：类与对象目标：了解面向对象编程的基础概念，并学会如何定义类和创建对象。内容：类与对象：定义类：class关键字。类的构造函数：__init__()。类的属性和方法。对象的创建与使用。示例：classStudent:def__init__(self,name,age,major):self.name&#
libyuv之linux编译 jaronho Linux linux 运维服务器
文章目录一、下载源码二、编译源码三、注意事项1、银河麒麟系统（aarch64）（1）解决armv8-a+dotprod+i8mm指令集支持问题（2）解决armv9-a+sve2指令集支持问题一、下载源码到GitHub网站下载https://github.com/lemenkov/libyuv源码，或者用直接用git克隆到本地，如：gitclonehttps://github.com/lemenko
pyecharts——绘制柱形图折线图 2224070247 信息可视化 python java 数据可视化
一、pyecharts概述自2013年6月百度EFE(ExcellentFrontEnd）数据可视化团队研发的ECharts1.0发布到GitHub网站以来，ECharts一直备受业界权威的关注并获得广泛好评，成为目前成熟且流行的数据可视化图表工具，被应用到诸多数据可视化的开发领域。Python作为数据分析领域最受欢迎的语言，也加入ECharts的使用行列，并研发出方便Python开发者使用的数据
node.js学习小猿L node.js node.js 学习 vim
node.js学习实操及笔记温故node.js，node.js学习实操过程及笔记~node.js学习视频node.js官网node.js中文网实操笔记githubcsdn笔记为什么学node.js可以让别人访问我们编写的网页为后续的框架学习打下基础，三大框架vuereactangular离不开node.jsnode.js是什么官网：node.js是一个开源的、跨平台的运行JavaScript的运行
Python 实现图片裁剪（附代码） | Python工具剑客阿良_ALiang
前言本文提供将图片按照自定义尺寸进行裁剪的工具方法，一如既往的实用主义。环境依赖ffmpeg环境安装，可以参考我的另一篇文章：windowsffmpeg安装部署_阿良的博客-CSDN博客本文主要使用到的不是ffmpeg，而是ffprobe也在上面这篇文章中的zip包中。ffmpy安装：pipinstallffmpy-ihttps://pypi.douban.com/simple代码不废话了，上代码
【华为OD技术面试真题 - 技术面】- python八股文真题题库（4) 算法大师华为od 面试 python
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选**1.Python中的`with`**用途和功能自动资源管理示例：文件操作上下文管理协议示例代码工作流程解析优点2.\_\_new\_\_和**\_\_init\_\_**区别__new____init__区别总结3.**切片（Slicing）操作**基本切片语法
python os 环境变量 CV矿工 python 开发语言 numpy
环境变量：环境变量是程序和操作系统之间的通信方式。有些字符不宜明文写进代码里，比如数据库密码，个人账户密码，如果写进自己本机的环境变量里，程序用的时候通过os.environ.get（）取出来就行了。os.environ是一个环境变量的字典。环境变量的相关操作importos"""设置/修改环境变量：os.environ[‘环境变量名称’]=‘环境变量值’#其中key和value均为string类
Python爬虫解析工具之xpath使用详解 eqa11 python 爬虫开发语言
文章目录Python爬虫解析工具之xpath使用详解一、引言二、环境准备1、插件安装2、依赖库安装三、xpath语法详解1、路径表达式2、通配符3、谓语4、常用函数四、xpath在Python代码中的使用1、文档树的创建2、使用xpath表达式3、获取元素内容和属性五、总结Python爬虫解析工具之xpath使用详解一、引言在Python爬虫开发中，数据提取是一个至关重要的环节。xpath作为一门
【华为OD技术面试真题 - 技术面】- python八股文真题题库（1）算法大师华为od 面试 python
华为OD面试真题精选专栏：华为OD面试真题精选目录:2024华为OD面试手撕代码真题目录以及八股文真题目录文章目录华为OD面试真题精选1.数据预处理流程数据预处理的主要步骤工具和库2.介绍线性回归、逻辑回归模型线性回归（LinearRegression）模型形式：关键点：逻辑回归（LogisticRegression）模型形式：关键点：参数估计与评估：3.python浅拷贝及深拷贝浅拷贝（Shal
nosql数据库技术与应用知识点皆过客，揽星河 NoSQL nosql 数据库大数据数据分析数据结构非关系型数据库
Nosql知识回顾大数据处理流程数据采集(flume、爬虫、传感器)数据存储(本门课程NoSQL所处的阶段)Hdfs、MongoDB、HBase等数据清洗(入仓)Hive等数据处理、分析(Spark、Flink等)数据可视化数据挖掘、机器学习应用(Python、SparkMLlib等)大数据时代存储的挑战(三高)高并发(同一时间很多人访问)高扩展(要求随时根据需求扩展存储)高效率(要求读写速度快)
《Python数据分析实战终极指南》 xjt921122 python 数据分析开发语言
对于分析师来说，大家在学习Python数据分析的路上，多多少少都遇到过很多大坑**，有关于技能和思维的**：Excel已经没办法处理现有的数据量了，应该学Python吗？找了一大堆Python和Pandas的资料来学习，为什么自己动手就懵了？跟着比赛类公开数据分析案例练了很久，为什么当自己面对数据需求还是只会数据处理而没有分析思路？学了对比、细分、聚类分析，也会用PEST、波特五力这类分析法，为啥
戴尔笔记本win8系统改装win7系统 sophia天雪 win7 戴尔改装系统 win8
戴尔win8 系统改装win7 系统详述第一步：使用U盘制作虚拟光驱： 1）下载安装UltraISO：注册码可以在网上搜索。 2）启动UltraISO，点击“文件”—》“打开”按钮，打开已经准备好的ISO镜像文
BeanUtils.copyProperties使用笔记 bylijinnan java
BeanUtils.copyProperties VS PropertyUtils.copyProperties 两者最大的区别是： BeanUtils.copyProperties会进行类型转换，而PropertyUtils.copyProperties不会。既然进行了类型转换，那BeanUtils.copyProperties的速度比不上PropertyUtils.copyProp
MyEclipse中文乱码问题 0624chenhong MyEclipse
一、设置新建常见文件的默认编码格式，也就是文件保存的格式。在不对MyEclipse进行设置的时候，默认保存文件的编码，一般跟简体中文操作系统（如windows2000，windowsXP）的编码一致，即GBK。在简体中文系统下，ANSI 编码代表 GBK编码;在日文操作系统下，ANSI 编码代表 JIS 编码。 Window-->Preferences-->General -
发送邮件不懂事的小屁孩 send email
import org.apache.commons.mail.EmailAttachment; import org.apache.commons.mail.EmailException; import org.apache.commons.mail.HtmlEmail; import org.apache.commons.mail.MultiPartEmail;
动画合集换个号韩国红果果 html css
动画指一种样式变为另一种样式 keyframes应当始终定义0 100 过程 1 transition 制作鼠标滑过图片时的放大效果 css .wrap{ width: 340px;height: 340px; position: absolute; top: 30%; left: 20%; overflow: hidden; bor
网络最常见的攻击方式竟然是SQL注入蓝儿唯美 sql注入
NTT研究表明，尽管SQL注入（SQLi）型攻击记录详尽且为人熟知，但目前网络应用程序仍然是SQLi攻击的重灾区。信息安全和风险管理公司NTTCom Security发布的《2015全球智能威胁风险报告》表明，目前黑客攻击网络应用程序方式中最流行的，要数SQLi攻击。报告对去年发生的60亿攻击行为进行分析，指出SQLi攻击是最常见的网络应用程序攻击方式。全球网络应用程序攻击中，SQLi攻击占
java笔记2 a-john java
类的封装： 1，java中，对象就是一个封装体。封装是把对象的属性和服务结合成一个独立的的单位。并尽可能隐藏对象的内部细节（尤其是私有数据） 2，目的：使对象以外的部分不能随意存取对象的内部数据（如属性），从而使软件错误能够局部化，减少差错和排错的难度。 3，简单来说，“隐藏属性、方法或实现细节的过程”称为——封装。 4，封装的特性： 4.1设置
[Andengine]Error：can't creat bitmap form path “gfx/xxx.xxx” aijuans 学习Android遇到的错误
最开始遇到这个错误是很早以前了，以前也没注意，只当是一个不理解的bug，因为所有的texture，textureregion都没有问题，但是就是提示错误。昨天和美工要图片，本来是要背景透明的png格式，可是她却给了我一个jpg的。说明了之后她说没法改，因为没有png这个保存选项。我就看了一下，和她要了psd的文件，还好我有一点
自己写的一个繁体到简体的转换程序 asialee java 转换繁体 filter 简体
今天调研一个任务，基于java的filter实现繁体到简体的转换，于是写了一个demo，给各位博友奉上，欢迎批评指正。实现的思路是重载request的调取参数的几个方法，然后做下转换。
android意图和意图监听器技术百合不是茶 android 显示意图隐式意图意图监听器
Intent是在activity之间传递数据;Intent的传递分为显示传递和隐式传递显式意图：调用Intent.setComponent() 或 Intent.setClassName() 或 Intent.setClass()方法明确指定了组件名的Intent为显式意图，显式意图明确指定了Intent应该传递给哪个组件。隐式意图;不指明调用的名称,根据设
spring3中新增的@value注解 bijian1013 java spring @Value
在spring 3.0中，可以通过使用@value，对一些如xxx.properties文件中的文件，进行键值对的注入，例子如下： 1.首先在applicationContext.xml中加入： <beans xmlns="http://www.springframework.
Jboss启用CXF日志 sunjing log jboss CXF
1. 在standalone.xml配置文件中添加system-properties： <system-properties> <property name="org.apache.cxf.logging.enabled" value=&
【Hadoop三】Centos7_x86_64部署Hadoop集群之编译Hadoop源代码 bit1129 centos
编译必需的软件 Firebugs3.0.0 Maven3.2.3 Ant JDK1.7.0_67 protobuf-2.5.0 Hadoop 2.5.2源码包 Firebugs3.0.0 http://sourceforge.jp/projects/sfnet_findbug
struts2验证框架的使用和扩展白糖_ 框架 xml bean struts 正则表达式
struts2能够对前台提交的表单数据进行输入有效性校验，通常有两种方式： 1、在Action类中通过validatexx方法验证，这种方式很简单，在此不再赘述； 2、通过编写xx-validation.xml文件执行表单验证，当用户提交表单请求后，struts会优先执行xml文件，如果校验不通过是不会让请求访问指定action的。本文介绍一下struts2通过xml文件进行校验的方法并说
记录-感悟 braveCS 感悟
再翻翻以前写的感悟，有时会发现自己很幼稚，也会让自己找回初心。 2015-1-11 1. 能在工作之余学习感兴趣的东西已经很幸福了； 2. 要改变自己，不能这样一直在原来区域，要突破安全区舒适区，才能提高自己，往好的方面发展； 3. 多反省多思考；要会用工具，而不是变成工具的奴隶； 4. 一天内集中一个定长时间段看最新资讯和偏流式博
编程之美-数组中最长递增子序列 bylijinnan 编程之美
import java.util.Arrays; import java.util.Random; public class LongestAccendingSubSequence { /** * 编程之美数组中最长递增子序列 * 书上的解法容易理解 * 另一方法书上没有提到的是，可以将数组排序（由小到大）得到新的数组， * 然后求排序后的数组与原数
读书笔记5 chengxuyuancsdn 重复提交 struts2的token验证
1、重复提交 2、struts2的token验证 3、用response返回xml时的注意 1、重复提交 (1)应用场景 (1-1)点击提交按钮两次。 (1-2)使用浏览器后退按钮重复之前的操作，导致重复提交表单。 (1-3)刷新页面 (1-4)使用浏览器历史记录重复提交表单。 (1-5)浏览器重复的 HTTP 请求。 (2)解决方法 (2-1)禁掉提交按钮 (2-2)
[时空与探索]全球联合进行第二次费城实验的可能性 comsci
二次世界大战前后,由爱因斯坦参加的一次在海军舰艇上进行的物理学实验 -费城实验至今给我们大家留下很多迷团..... 关于费城实验的详细过程,大家可以在网络上搜索一下,我这里就不详细描述了在这里,我的意思是,现在
easy connect 之 ORA-12154: TNS: 无法解析指定的连接标识符 daizj oracle ORA-12154
用easy connect连接出现“tns无法解析指定的连接标示符”的错误，如下： C:\Users\Administrator>sqlplus username/[email protected]:1521/orcl SQL*Plus: Release 10.2.0.1.0 – Production on 星期一 5月 21 18:16:20 2012 Copyright (c) 198
简单排序:归并排序 dieslrae 归并排序
public void mergeSort(int[] array){ int temp = array.length/2; if(temp == 0){ return; } int[] a = new int[temp]; int
C语言中字符串的\0和空格 dcj3sjt126com c
\0 为字符串结束符，比如说： abcd (空格)cdefg；存入数组时，空格作为一个字符占有一个字节的空间，我们
解决Composer国内速度慢的办法 dcj3sjt126com Composer
用法：有两种方式启用本镜像服务： 1 将以下配置信息添加到 Composer 的配置文件 config.json 中（系统全局配置）。见“例1” 2 将以下配置信息添加到你的项目的 composer.json 文件中（针对单个项目配置）。见“例2” 为了避免安装包的时候都要执行两次查询，切记要添加禁用 packagist 的设置，如下 1 2 3 4 5
高效可伸缩的结果缓存 shuizhaosi888 高效可伸缩的结果缓存
/** * 要执行的算法，返回结果v */ public interface Computable<A, V> { public V comput(final A arg); } /** * 用于缓存数据 */ public class Memoizer<A, V> implements Computable<A,
三点定位的算法 haoningabc c 算法
三点定位，已知a,b,c三个顶点的x,y坐标和三个点都z坐标的距离，la，lb,lc 求z点的坐标原理就是围绕a,b,c 三个点画圆，三个圆焦点的部分就是所求但是，由于三个点的距离可能不准，不一定会有结果，所以是三个圆环的焦点，环的宽度开始为0，没有取到则加1 运行 gcc -lm test.c test.c代码如下 #include "stdi
epoll使用详解 jimmee c linux 服务端编程 epoll
epoll - I/O event notification facility在linux的网络编程中，很长的时间都在使用select来做事件触发。在linux新的内核中，有了一种替换它的机制，就是epoll。相比于select，epoll最大的好处在于它不会随着监听fd数目的增长而降低效率。因为在内核中的select实现中，它是采用轮询来处理的，轮询的fd数目越多，自然耗时越多。并且，在linu
Hibernate对Enum的映射的基本使用方法 linzx0212 enum Hibernate
枚举 /** * 性别枚举 */ public enum Gender { MALE(0), FEMALE(1), OTHER(2); private Gender(int i) { this.i = i; } private int i; public int getI
第10章高级事件（下） onestopweb 事件
index.html <!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"> <html xmlns="http://www.w3.org/
孙子兵法 roadrunners 孙子兵法
始计第一孙子曰：兵者，国之大事，死生之地，存亡之道，不可不察也。故经之以五事，校之以计，而索其情：一曰道，二曰天，三曰地，四曰将，五曰法。道者，令民于上同意，可与之死，可与之生，而不危也；天者，阴阳、寒暑、时制也；地者，远近、险易、广狭、死生也；将者，智、信、仁、勇、严也；法者，曲制、官道、主用也。凡此五者，将莫不闻，知之者胜，不知之者不胜。故校之以计，而索其情，曰
MySQL双向复制 tomcat_oracle mysql
本文包括: 主机配置从机配置建立主-从复制建立双向复制背景按照以下简单的步骤: 参考一下：在机器A配置主机(192.168.1.30) 在机器B配置从机(192.168.1.29) 我们可以使用下面的步骤来实现这一点步骤1：机器A设置主机在主机中打开配置文件 ,
zoj 3822 Domination(dp) 阿尔萨斯 Mina
题目链接：zoj 3822 Domination 题目大意：给定一个N∗M的棋盘，每次任选一个位置放置一枚棋子，直到每行每列上都至少有一枚棋子，问放置棋子个数的期望。解题思路：大白书上概率那一张有一道类似的题目，但是因为时间比较久了，还是稍微想了一下。dp[i][j][k]表示i行j列上均有至少一枚棋子，并且消耗k步的概率（k≤i∗j）,因为放置在i+1~n上等价与放在i+1行上，同理

调用“抱抱脸团队打造的Transformers pipeline API” && 通过预训练模型，快速训练和微调自己的模型

一、Torch官方下载

二、Transformers以及相关包的安装

三、预处理（调用Transformers API）

（1）文本预处理

（2）音频预处理

（3）图像预处理

（4）多模式任务

四、训练与微调

（1）使用 Transformers Trainer 微调预训练模型。

（2）在原生 PyTorch 中 微调预训练模型。

你可能感兴趣的:(Pytorch_python,GitHub,transformer,深度学习,pytorch,python,神经网络)

（2）在原生 PyTorch 中微调预训练模型。