chvalrous

用Tensorflow实现CNN文本分类(详细解释及TextCNN代码解释)

本文转载自:http://www.dataguru.cn/forum.php?mod=viewthread&tid=637971&extra=page=1&page=1

Ox00: Motivation最近在研究Yoon Kim的一篇经典之作Convolutional Neural Networks for Sentence Classification，这篇文章可以说是cnn模型用于文本分类的开山之作（其实第一个用的不是他，但是Kim提出了几个variants，并有详细的调参）
wildml对这篇paper有一个tensorflow的实现，具体参见here。其实blog已经写的很详细了，但是对于刚入手tensorflow的新人来说代码可能仍存在一些细节不太容易理解，我也是初学，就简单总结下自己的理解，如果对读者有帮助那将是极好的。
Ox01: Start!我主要对TextCNN这个类进行解读，具体代码在这里。

研究别人代码时，时常问自己几个问题，由问题切入，在读的过程中找答案，这种方式我个人认为是最efficient的

1 这个class的主要作用是什么？ TextCNN类搭建了一个最basic的CNN模型，有input layer，convolutional layer，max-pooling layer和最后输出的softmax layer。
但是又因为整个模型是用于文本的(而非CNN的传统处理对象：图像)，因此在cnn的操作上相对应地做了一些小调整：

对于文本任务，输入层自然使用了word embedding来做input data representation。
接下来是卷积层，大家在图像处理中经常看到的卷积核都是正方形的，比如4*4，然后在整张image上沿宽和高逐步移动进行卷积操作。但是nlp中输入的“image”是一个词矩阵，比如n个words，每个word用200维的vector表示的话，这个”image”就是n*200的矩阵，卷积核只在高度上已经滑动，在宽度上和word vector的维度一致（=200），也就是说每次窗口滑动过的位置都是完整的单词，不会将几个单词的一部分“vector”进行卷积，这也保证了word作为语言中最小粒度的合理性。（当然，如果研究的粒度是character-level而不是word-level，需要另外的方式处理）
由于卷积核和word embedding的宽度一致，一个卷积核对于一个sentence，卷积后得到的结果是一个vector， shape=（sentence_len - filter_window + 1, 1），那么，在max-pooling后得到的就是一个Scalar。所以，这点也是和图像卷积的不同之处，需要注意一下。
正是由于max-pooling后只是得到一个scalar，在nlp中，会实施多个filter_window_size（比如3,4,5个words的宽度分别作为卷积的窗口大小），每个window_size又有num_filters个（比如64个）卷积核。一个卷积核得到的只是一个scalar太孤单了，智慧的人们就将相同window_size卷积出来的num_filter个scalar组合在一起，组成这个window_size下的feature_vector。
最后再将所有window_size下的feature_vector也组合成一个single vector，作为最后一层softmax的输入。

重要的事情说三遍：一个卷积核对于一个句子，convolution后得到的是一个vector；max-pooling后，得到的是一个scalar。

如果对上述讲解还有什么不理解的地方，请移步wildml的另一篇 blog ，包教包会。
说了这么多，总结一下这个类的作用就是：搭建一个用于文本数据的CNN模型！
2 一些参数既然TextCNN类是基于YoonKim的思路搭建的，那么我们接下来一个很重要的步骤就是将paper中提到的各种参数设置都整理出来，有一些参数是关于模型的，有一些参数是关于training的，比如epoch等，这类参数就和模型本身无关，以此来确定我们的TextCNN类需要传递哪些参数来初始化。
赶紧把 paper 打开，来仔细找找参数吧。
3.1节Hyperparameters and Training部分讲到一些，还有一部分在Table1中：
关于model

filter windows: [3,4,5]
filter maps: 100 for each filter window
dropout rate: 0.5
l2 constraint: 3
randomly select 10% of training data as dev set(early stopping)
word2vec(google news) as initial input, dim = 300
sentence of length: n, padding where necessary
number of target classes
dataset size
vocabulary size

关于training

mini batch size: 50
shuffuled mini batch
Adadelta update rule: similar results to Adagrad but required fewer epochs
Test method: standard train/test split ot CV

3 Dropout注意事项正则是解决过拟合的问题，在最后一层softmax的时候是full-connected layer，因此容易产生过拟合。
策略就是在：
在训练阶段，对max-pooling layer的输出实行一些dropout，以概率p激活，激活的部分传递给softmax层。
在测试阶段，w已经学好了，但是不能直接用于unseen sentences，要乘以p之后再用，这个阶段没有dropout了全部输出给softmax层。
4 Embedding Layer

1
2
3
4
5
6
7

# Embedding layer
with tf.device('/cpu:0'), tf.name_scope("embedding"):
W = tf.Variable(
tf.random_uniform([vocab_size, embedding_size], -1.0, 1.0),
name="W")
self.embedded_chars = tf.nn.embedding_lookup(W, self.input_x)
self.embedded_chars_expanded = tf.expand_dims(self.embedded_chars, -1)

存储全部word vector的矩阵

W

W初始化时是随机random出来的，也就是paper中的第一种模型CNN-rand
训练过程中并不是每次都会使用全部的vocabulary，而只是产生一个batch（batch中都是sentence，每个sentence标记了出现哪些word(最大长度为sequence_length)，因此batch相当于一个二维列表），这个batch就是input_x。

1	self.input_x = tf.placeholder(tf.int32, [None, sequence_length], name="input_x")

tf.nn.embedding_lookup:查找input_x中所有的ids，获取它们的word vector。batch中的每个sentence的每个word都要查找。所以得到的embedded_chars的shape应该是[None, sequence_length, embedding_size]（1）
但是，输入的word vectors得到之后，下一步就是输入到卷积层，用到tf.nn.conv2d函数，
再看看conv2d的参数列表：
input: [batch, in_height, in_width, in_channels]（2）
filter: [filter_height, filter_width, in_channels, out_channels]（3）
对比（1）（2）可以发现，就差一个in_channels了，而最simple的版本也就只有1通道（Yoon的第四个模型用到了multichannel）
因此需要expand dim来适应conv2d的input要求，万能的tensorflow已经提供了这样的功能：

This operation is useful if you want to add a batch dimension to a single element. For example, if you have a single image of shape [height, width, channels], you can make it a batch of 1 image with expand_dims(image, 0), which will make the shape [1, height, width, channels].
Example:
# ‘t’ is a tensor of shape [2]
shape(expand_dims(t, -1)) ==> [2, 1]

因此只需要

1	tf.expand_dims(self.embedded_chars, -1)

就能在embedded_chars后面加一个in_channels=1
5 Conv and Max-pooling

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29

# Create a convolution + maxpool layer for each filter size
pooled_outputs = []
for i, filter_size in enumerate(filter_sizes):
with tf.name_scope("conv-maxpool-%s" % filter_size):
      # Convolution Layer
      filter_shape = [filter_size, embedding_size, 1, num_filters]
      W = tf.Variable(tf.truncated_normal(filter_shape, stddev=0.1), name="W")
      b = tf.Variable(tf.constant(0.1, shape=[num_filters]), name="b")
      conv = tf.nn.conv2d(
         self.embedded_chars_expanded,
         W,
         strides=[1, 1, 1, 1],
         padding="VALID",
         name="conv")
      # Apply nonlinearity
      h = tf.nn.relu(tf.nn.bias_add(conv, b), name="relu")
      # Maxpooling over the outputs
      pooled = tf.nn.max_pool(
         h,
         ksize=[1, sequence_length - filter_size + 1, 1, 1],
         strides=[1, 1, 1, 1],
         padding='VALID',
         name="pool")
      pooled_outputs.append(pooled)

# Combine all the pooled features
num_filters_total = num_filters * len(filter_sizes)
self.h_pool = tf.concat(3, pooled_outputs)
self.h_pool_flat = tf.reshape(self.h_pool, [-1, num_filters_total])

首先，对filter_sizes中的每一个filter_window_size都要进行卷积（每一种size都要产生num_filters那么多个filter maps），所以外层就是一个大的for循环。
继续，看到了一个比较陌生的函数tf.name_scope('xxx')
这个函数的作用参见官方文档
由于在for循环内部，filter_size是固定了的，因此可以结合（3）：[filter_height, filter_width, in_channels, out_channels]得到，filter_shape = [filter_size, embedding_size, 1, num_filters]
之所以要弄清楚filter shape是因为要对filter的权重矩阵w进行初始化：

1	W = tf.Variable(tf.truncated_normal(filter_shape, stddev=0.1), name="W")

这里为什么要用tf.truncated_normal()函数呢？
答：tensorflow中提供了两个normal函数：

tf.random_normal(shape, mean=0.0, stddev=1.0, dtype=tf.float32, seed=None, name=None)
tf.truncated_normal(shape, mean=0.0, stddev=1.0, dtype=tf.float32, seed=None, name=None)

对比了一下，这两个函数的参数列表完全相同，不同之处我就直接引用文档中的说明，讲解的很清楚，

Outputs random values from a truncated normal distribution.
The generated values follow a normal distribution with specified mean and standard deviation, except that values whose magnitude is more than 2 standard deviations from the mean are dropped and re-picked.

也就是说random出来的值的范围都在[mean - 2 standard_deviations, mean + 2 standard_deviations]内。
下图可以告诉你这个范围在哪，

conv2d得到的其实是下图中的

w\cdotx w\cdotx的部分， 还要加上bias项tf.nn.bias_add(conv, b)，并且通过relu：tf.nn.relu才最终得到卷积层的输出 h h。 那究竟卷积层的输出的shape是什么样呢？ 官方文档中有一段话解释了卷积后得到的输出结果： 第三部进行了right-multiply之后得到的结果就是 [batch, out_height, out_width, output_channels] ，但是还是不清楚这里的out_height和out_width到底是什么。 那就看看wildml中怎么说的吧

“VALID” padding means that we slide the filter over our sentence without padding the edges, performing a narrow convolution that gives us an output of shape [1, sequence_length - filter_size + 1, 1, 1].

哦，这句话的意思是说out_height和out_width其实和padding的方式有关系，这里选择了”VALID”的方式，也就是不在边缘加padding，得到的out_height=sequence_length - filter_size + 1，out_width=1
因此，综合上面的两个解释，我们知道conv2d-加bias-relu之后得到的

h h的shape= [batch, sequence_length - filter_size + 1, 1, num_filters]

接下来的工作就是max-pooling了，来看一下tensorflow中给出的函数:
tf.nn.max_pool(value, ksize, strides, padding, data_format='NHWC', name=None)

其中最重要的两个参数是value和ksize。
value相当于是max pooling层的输入，在整个网络中就是刚才我们得到的

h h，check了一下它俩的shape是一致的，说明可以直接传递到下一层。 另一个参数是ksize，官方解释说是input tensor每一维度上的window size。仔细想一下，其实就是想定义多大的范围来进行max-pooling，比如在图像中常见的2*2的小正方形区域对整个h得到feature map进行pooling，但是在nlp中，刚才说到了每一个feature map现在是 [batch, sequence_length - filter_size + 1, 1, num_filters] 维度的，我们想知道每个output_channels（每个channel是一个vector）的最大值，也就是最重要的feature是哪一个，那么就是在第二个维度上设定window=sequence_length - filter_size + 1【这里感觉没解释通，待后续探索】 根据ksize的设置，和value的shape，可以得到pooled的shape= [batch, 1, 1, num_filters] ， 这是一个filter_size的结果（比如filter_size = 3），pooled存储的是当前filter_size下每个sentence最重要的num_filters个features，结果append到pooled_outputs列表中存起来，再对下一个filter_size进行相同的操作。

等到for循环结束时，也就是所有的filter_size全部进行了卷积和max-pooling之后，首先需要把相同filter_size的所有pooled结果concat起来，再将不同的filter_size之间的结果concat起来，最后的到的应该类似于二维数组，[batch, all_pooled_result]
all_pooled_result一共有num_filters\（100）*len(filter_sizes)（3）个，比如300个
连接的过程需要使用 tf.concat ，官方给出的例子很容易理解。
最后得到的h_pool_flat也就是[batch, 300]维的tensor。
6 Dropout

1
2
3

# Add dropout
with tf.name_scope("dropout"):
self.h_drop = tf.nn.dropout(self.h_pool_flat, self.dropout_keep_prob)

前面在“dropout注意事项”中讲到了，dropout仅对hiddenlayer的输出层进行drop，使得有些结点的值不输出给softmax层。
7 Output

1
2
3
4
5
6
7
8
9
10
11
12

# Final (unnormalized) scores and predictions
with tf.name_scope("output"):
W = tf.get_variable(
      "W",
      shape=[num_filters_total, num_classes],
      initializer=tf.contrib.layers.xavier_initializer())
b = tf.Variable(tf.constant(0.1, shape=[num_classes]), name="b")
l2_loss += tf.nn.l2_loss(W)
l2_loss += tf.nn.l2_loss(b)
self.scores = tf.nn.xw_plus_b(self.h_drop, W, b, name="scores")
self.predictions = tf.argmax(self.scores, 1, name="predictions")

输出层其实是个softmax分类器，没什么可讲的，但是要注意l2正则（虽然有paper说l2加不加并没有什么区别）
但是我还有一个疑问是为什么对b也要进行正则约束？
另外，tf.nn.xw_plus_b()在open api中并没有提供，参考github上的某个 issue
因此可以改为tf.matmul(self.h_drop, W) + b但是不好的地方是无法设置name了。。（用xw_plus_b也不会报错不改也可以）
还有一个奇怪的地方是，这一层按道理说应该是一个softmax layer，但是并没有使用到softmax函数，在Yoon的文章中也是直接得到输出的，

因此，我们也按照这种方式写代码，得到所有类别的score，并且选出最大值的那个类别(argmax)
y的shape为[batch, num_classes]，因此argmax的时候是选取每行的max，dimention=1
因此，最后scores的shape为[batch, 1]
8 Loss function 得到了整个网络的输出之后，也就是我们得到了y_prediction，但还需要和真实的y label进行比较，以此来确定预测好坏。

1
2
3
4

# CalculateMean cross-entropy loss
with tf.name_scope("loss"):
losses = tf.nn.softmax_cross_entropy_with_logits(self.scores, self.input_y)
self.loss = tf.reduce_mean(losses) + l2_reg_lambda * l2_loss

还是使用常规的cross_entropy作为loss function。最后一层是全连接层，为了防止过拟合，最后还要在loss func中加入l2正则项，即l2_loss。l2_reg_lambda来确定惩罚的力度。
9 Accuracy

1
2
3
4

# Accuracy
with tf.name_scope("accuracy"):
correct_predictions = tf.equal(self.predictions, tf.argmax(self.input_y, 1))
self.accuracy = tf.reduce_mean(tf.cast(correct_predictions, "float"), name="accuracy")

tf.equal(x, y)返回的是一个bool tensor，如果xy对应位置的值相等就是true，否则false。得到的tensor是[batch, 1]的。
tf.cast(x, dtype)将bool tensor转化成float类型的tensor，方便计算
tf.reduce_mean()本身输入的就是一个float类型的vector（元素要么是0.0，要么是1.0），直接对这样的vector计算mean得到的就是accuracy，不需要指定reduction_indices
0x02: Conclusion 后续可能还会对其他部分进行解读，敬请期待。

程序员如何用DeepSeek让代码效率翻倍？这份实战手册请收好后端
最近公司新来的实习生小张让我眼前一亮，上周他只用三小时就完成了原本需要两天的工作量——优化一个老旧的后端接口。当我翻开他的代码才发现，这个00后小伙子的秘密武器居然是个叫DeepSeek的AI工具。你可能已经注意到，GitHub上越来越多的开源项目开始标注"DeepSeek适配"的字样。这个由中国团队自主研发的大模型，正在悄然改变程序员的工作方式。还记得去年调试分布式系统时的痛苦经历吗？当时我对着
机器学习(Machine Learning) 七指琴魔御清绝大数据学习
原文链接：http://blog.csdn.net/zhoubl668/article/details/42921187希望转载的朋友，你可以不用联系我．但是一定要保留原文链接，因为这个项目还在继续也在不定期更新．希望看到文章的朋友能够学到更多．《BriefHistoryofMachineLearning》介绍:这是一篇介绍机器学习历史的文章，介绍很全面，从感知机、神经网络、决策树、SVM、Ada
Flutter中使用NetworkImage加载网络图片缓存问题学习实践云水-禅心 flutter 缓存
Flutter中默认的NetworkImage会有缓存机制，如果图片的url不变化，但是url的图片已经发生变化，NetworkImage不会下载新的图片deepseek是这么解决问题的，但是在鸿蒙上禁用缓存无效在Flutter中，NetworkImage默认会使用缓存机制来优化性能。如果你想禁用缓存，可以通过以下几种方式实现：1.使用NetworkImage的headers参数你可以通过设置he
LWC-KD：图结构感知的推荐系统增量学习对比知识蒸馏宇直不会放弃 GKD-Middle layer 人工智能 python chatgpt gpu算力深度学习机器学习神经网络
LWC-KD：图结构感知的推荐系统增量学习对比知识蒸馏《GraphStructureAwareContrastiveKnowledgeDistillationforIncrementalLearninginRecommenderSystems》2021作者是YueningWang、YingxueZhang和MarkCoates论文地址：https://dl.acm.org/doi/10.1145/
程序员必看！DeepSeek隐藏用法大揭秘：从代码优化到多模态开发，这些技巧让你少熬三夜班后端
最近在程序员圈子里，有个同事老张的故事特别火。他原本每周要花20小时写接口文档，自从用上DeepSeek的代码补全功能，现在喝着咖啡看AI自动生成Swagger注释——这让我想起刚入行时，为了调通一个正则表达式熬夜到凌晨三点的自己。今天咱们不聊那些官方说明书，就说点真正能让键盘冒火星的实战技巧。藏在代码补全里的"作弊码"很多人以为DeepSeek就是个加强版搜索引擎，其实它对代码的理解远超想象。比
如何在DigitalOcean的H100 GPU服务器上运行DeepSeek R1 模型 DO_Community 教程 DeepSeek GPU ai 大语言模型人工智能
在DigitalOcean，我们一直在关注开源大语言模型（LLMs）和商业封闭模型之间差距的不断缩小。其中一个最关键的能力就是“推理”，也就是用合乎逻辑、讲得通的方式思考问题。以前，大语言模型的表现比较单一。只要给它们一个提示，它们就会直接给出答案，根本没有什么“二次思考”的过程，也没有什么机制能让模型在出错时自己纠正。这就让它们在遇到那些指令本身就可能有问题的情况时，很难进行深入推理、提出疑问或
清华大学出品《DeepSeek从入门到精通》超详细使用手册pdf 2501_90570130 pdf 人工智能
链接：https://pan.quark.cn/s/70da09749050清华大学新闻与传播学院团队发布了长达104页的DeepSeek详细使用手册，该手册成为国产AI工具DeepSeek深度使用的标杆指南。手册内容涵盖基础入门、核心能力与模型对比、进阶提示语策略、场景化应用以及人机协作与能力进阶等方面。它不仅适合新手快速掌握DeepSeek的基础操作，还为进阶用户提供了系统性方法论。
QPython双核攻略：从零基础到AI开发，你的手机就是全栈训练营程之编 python 开发语言青少年编程人工智能
主题一：《编程小白必看！在手机上种下你的第一行代码》✨北京优趣天下信息技术有限公司重磅出品我们比谁都清楚：✔️86%的初学者因环境配置放弃编程✔️72%的上班族只有碎片化学习时间✔️95%的自学者需要即时答疑支持为什么QPython成为2025现象级学习工具？▸全栈开发环境：解释器+编辑器+控制台三合一▸AI导师常驻：集成DeepSeek代码助手（支持中英双语提问）▸极速学习路径：Q派课程7天完成
第五周作业——第十章动手试一试 hongsqi
10-1Python学习笔记学习笔记：在文本编辑器中新建一个文件，写几句话来总结一下你至此学到的Python知识，其中每一行都以“InPythonyoucan”打头。将这个文件命名为learning_python.txt，并将其存储到为完成本章练习而编写的程序所在的目录中。编写一个程序，它读取这个文件，并将你所写的内容打印三次：第一次打印时读取整个文件；第二次打印时遍历文件对象；第三次打印时将各行
通过 Ollama 本地部署 DeepSeek-r1:1.5b 模型后，用 Python 调用推理并生成基于 pytest + PO 设计模式的 Playwright 自动化测试文件 Python测试之道测试提效 python python pytest 设计模式
以下是完整的实现步骤和代码示例，详细说明了如何通过Python调用本地部署的DeepSeek-r1:1.5b模型，将功能测试用例转换为适合pytest和PageObject（PO）设计模式的Playwright自动化测试脚本。一、前提条件DeepSeek模型本地部署通过Ollama部署DeepSeek-r1:1.5b模型。Ollama提供的本地推理服务默认可通过HTTPAPI访问，地址通常为：ht
Ollama 已部署DeepSeek模型，如果用Java语言实现调用 meisongqing java 开发语言人工智能 llama
以下是使用Java调用Ollama部署的DeepSeek模型的详细方法：1.通过HTTPAPI调用（推荐）Ollama提供了RESTfulAPI，可以用Java的HTTP客户端库（如OkHttp）直接调用。步骤1：添加依赖在Maven项目的pom.xml中添加：xml复制com.squareup.okhttp3okhttp4.12.0com.google.code.gsongson2.10.1运行
DeepSeek + Cline：编程如何加速引擎 meisongqing 人工智能
DeepSeek与Cline的结合为编程工作流提供了显著的加速能力，这种组合通过AI辅助规划、代码生成与优化、实时调试等功能，大幅提升开发效率。以下是具体实现方式及技术要点：一、智能规划与代码生成问题分析与规划（Plan模式）DeepSeek-R1模型擅长处理复杂逻辑推理，开发者可在Cline的Plan模式下用自然语言描述需求（如“用Python实现数据清洗并计算平均值”）。DeepSeek会根据
DeepSeek 根据图片内容画架构图 meisongqing 人工智能架构
架构图文字描述分部组织系统├──平台首页（后台管理）│├──招生管理│├──学籍管理│├──教务管理│├──教学管理│├──财务管理（需确认重复项）│├──毕业管理│└──系统管理│└──工作平台（用户界面）├──学生空间├──教师空间├──教学报告├──通知公告└──下载中心Mermaid代码（可直接生成流程图）mermaid复制graphTDA[分部组织系统]-->B[平台首页]A-->C[工
Python 变量起名全攻略：新手避坑与大神指南科雷learning 学习AI python编程 python 开发语言
学习AI科雷learning2025年03月10日22:19江苏一、引言：变量起名的“玄学”难题在Python编程的世界里，变量命名看似简单，实则暗藏玄机，常常让新手们踩坑不断。本文将带你深入了解Python变量命名规则，助你从新手小白变身命名大神。二、基础规则：保命口诀要牢记小白的困惑小白：（举着写满报错的代码）大神快看！我就写了个3D效果=True，Python竟然说我语法错误？专家的解答专家
【大模型开发】深入解析 DeepSpeed：原理、核心技术与示例代码云博士的AI课堂大模型技术开发与实践哈佛博后带你玩转机器学习深度学习大模型开发大模型微调 deepseek deepspeed python 人工智能 pytorch
深入解析DeepSpeed：原理、核心技术与示例代码DeepSpeed是由微软开源的高性能深度学习训练优化引擎，专注于帮助研究人员和工程团队在分布式环境中高效地训练超大规模模型。其核心目标是提供高吞吐、低内存占用、低成本的分布式训练方案，让数千亿甚至万亿级参数模型的训练成为可能。本文将从DeepSpeed的核心原理、关键组件、代码示例及实现过程详解等方面做详细阐述，帮助读者更好地理解并使用Deep
【大模型开发】大模型背后的基础组件与生态概览云博士的AI课堂深度学习哈佛博后带你玩转机器学习大模型技术开发与实践大模型开发 Hugging Face DeepSpeed 大模型生态机器学习深度学习大模型技术栈
支撑大模型开发与部署的关键组件与生态系统当今大模型（LLM,LargeLanguageModel）在工业与学术界的应用日益广泛，从ChatGPT、BERT到DeepSeek等新兴模型，背后离不开一整套成熟的技术生态和工具链支持。本文将介绍其中几大核心组件和框架，包括HuggingFaceTransformers、DeepSpeed、Megatron-LM，以及其他相关工具和方法，展示它们在训练效率
2025 年，微服务架构和大模型能 “玩出” 什么新花样？字节跳动开源架构微服务人工智能
2025年开年，DeepSeek开源模型以“低成本、高性能”成功掀起AI平价化浪潮，并以惊人的速度渗透至各个领域。在AI平价化浪潮的推动下，微服务架构正迎来前所未有的变革机遇。微服务架构通过将系统拆解为多个小型、独立的服务，每个服务运行在自己的进程中，负责特定的业务功能。与单体架构相比，微服务架构实现了更高的灵活性、可扩展性和可维护性，这些特性使其成为现代软件开发的首选。然而，随着企业应用规模和复
python调用ollama本地部署的deepseek 小杰丶 python 开发语言
说明在本地主机上调用局域网内使用ollama部署好的deepseek。之前的文章中已经部署好，并调试通的网络，现在需要使用python能调用deepseek的API，便于后续的模型探索和应用开发。但是百度了很多，没一个能用的，各种无脑的复制粘贴，最后还是老实得去看官方文档，还是自己记录一下比较好。正文使用ollama的pythonlib包进行deepseek的调用。pypyi地址：ollama·P
OpenBayes 教程上新 | 性能比肩满血版 DeepSeek-R1，QwQ-32B 一键部署教程上线
上周，阿里云突发大招，强势开源了全新推理模型通义千问QwQ-32B。在多个关键基准测试上，其以32B的参数量，超越了OpenAI-o1-mini，比肩671B参数的满血版DeepSeek-R1。QwQ-32B不仅性能哇塞，在保持强劲性能的同时，它还大幅降低了部署使用成本，在消费级显卡上也能实现本地部署，堪称实力与性价比的典范。QwQ-32B在多项基准测试中与DeepSeek-R1-671B等推理模
【DeepSeek问答】Qt布局和控件的关系 CSUC qt
在Qt中，布局管理器（Layout）与控件（Widget）的关系是容器与内容的关系。布局负责自动管理控件的排列、尺寸调整和自适应，确保界面在不同窗口尺寸下保持美观和功能。以下是详细说明及用法示例：一、布局与控件的关系容器与内容：布局（如QVBoxLayout、QHBoxLayout）作为容器，管理其内部控件的位置和大小。控件（如QPushButton、QLabel）是布局中的内容，通过addWid
【DeepSeek问答】QProcess::start是异步的吗?会使UI卡顿吗？ CSUC qt
好的，我现在需要回答用户关于QProcess::start是否是异步的，以及它是否会导致UI卡顿的问题。用户之前已经询问过如何开发一个调用7-Zip的Qt应用，并且我给出了示例代码。现在用户可能在使用过程中遇到了问题，或者想更深入了解QProcess的工作机制。首先，我需要确认QProcess::start的异步性。根据Qt文档，QProcess::start确实是异步的。它会立即返回，而不会等待
我与DeepSeek的深度实践：重新定义智能编程的边界一叶孤舟111 python 人工智能
引言：从质疑到依赖的认知跃迁在ChatGPT掀起AI编程革命之初，我曾对代码生成工具持保留态度。直到2023年接触DeepSeek，这个来自中国的AI编程助手彻底改变了我的开发模式。经过200+小时的深度使用，我在实际项目中验证了其惊人潜力，本文将分享最具实践价值的经验总结。一、效率革命：实测数据背后的生产力跃升1.1代码生成效率对比任务类型传统耗时DeepSeek耗时准确率CRUD接口开发2.5
【DeepSeek问答】访问QStandardItemModel::index(r,c)获取的空索引导致程序崩溃 CSUC qt
好的，我现在来仔细思考一下用户的问题。用户在使用QStandardItemModel的setItem方法时，调用了setItem(4,6,item)，也就是在第4行第6列的位置设置了一个item。然后他们尝试通过index(3,6)来获取这个位置的项目，想知道会有什么后果。首先，我需要回忆一下QStandardItemModel的索引机制。Qt中的模型视图框架里，行和列的索引是从0开始的。所以se
XGBClassifiler函数介绍浊酒南街 #算法机器学习 XGB
目录前言函数介绍示例前言XGBClassifier是XGBoost库中用于分类任务的类。XGBoost是一种高效且灵活的梯度提升决策树（GBDT）实现，它在多种机器学习竞赛中表现出色，尤其擅长处理表格数据。函数介绍XGBClassifiler(max_depth=3,learning_rate=0.1,n_estimators=100,objective='binary:logistic',boo
使用Activeloop Deep Lake构建深度学习数据仓库与向量存储 dgay_hua 深度学习人工智能 python
技术背景介绍随着深度学习技术的发展，数据的存储与管理成为了一个重要的问题。尤其是对于需要处理大量数据的应用，例如自然语言处理和图像识别，传统的数据存储方式已经无法满足需求。ActiveloopDeepLake是专为深度学习设计的数据仓库，可以作为向量存储使用，支持多模态数据的存储和处理，并且可以直接用于细调大型语言模型（LLMs）。此外，它还提供自动版本控制，无需依赖其他服务，兼容主要云服务提供商
【带你 langchain 双排系列教程】8.LangChain开发Agent智能体：从入门到实战夜里慢慢行456 双排人工智能 python langchain
一、什么是LangChain？LangChain是一个专为构建大模型应用设计的开发框架，其模块化设计和丰富的工具链让智能体开发更高效。相比传统开发，LangChain提供以下核心优势：内置Agent模板：快速实现工具调用、多轮对话、记忆管理。无缝对接主流大模型：支持OpenAI、ChatGLM、DeepSeek等。灵活可扩展：通过Chains组合实现复杂业务逻辑。二、快速开始：环境搭建与基础配置1
程序员如何用DeepSeek改写代码人生？这些硬核技巧让你效率翻三倍后端
凌晨三点的深圳华强北依然灯火通明，老王调试着双卡4090服务器上的DeepSeekR1模型，屏幕上跳动的代码像夜空中闪烁的星群。他刚用这个开源神器重构了公司积压三个月的遗留系统，此刻正喝着浓茶感叹——原来AI不是取代程序员，而是让我们从重复劳动中解放出来，去做真正创造性的工作。最近圈子里都在疯传DeepSeek的魔幻操作：微软悄悄把它集成进Copilot当备胎，Meta连夜开会讨论要不要引进，连东
湖南大学的 DeepSeek 教程来了 2501_90850551 人工智能 pdf
链接：https://pan.quark.cn/s/79b8b14e2c56我们之前已经分享了清华大学和北京大学出品的DeepSeek系列教程。今天接着分享一份湖南大学出品的PDF
清华大学DeepSeek系列全套PPT 2501_90850551 人工智能 pdf
链接：https://pan.quark.cn/s/70da09749050「清华大学DeepSeek系列PPT」共7讲，涵盖AI工具实操、职场效率提升、科研辅助、家庭教育等核心场景，提供从入门到进阶的完整学习路径
清华、北大DeepSeek使用手册：8本，698页大合集 2501_90850576 人工智能 pdf
链接：https://pan.quark.cn/s/79b8b14e2c56以前看了很多教程，都感觉特别花哨，没啥干货，大部分就是把GPT的说明书稍微改改，就拿来用在DeepSeek上了，没啥用。但清华和北大这个手册完全不一样！它先是给你讲清楚原理，然后手把手教你怎么科学地使用。它不只是告诉你怎么提问，还会告诉你为啥要这么问，这不就是教你怎么掌握提示词的底层逻辑嘛。
继之前的线程循环加到窗口中运行 3213213333332132 java thread JFrame JPanel
之前写了有关java线程的循环执行和结束，因为想制作成exe文件，想把执行的效果加到窗口上，所以就结合了JFrame和JPanel写了这个程序，这里直接贴出代码，在窗口上运行的效果下面有附图。 package thread; import java.awt.Graphics; import java.text.SimpleDateFormat; import java.util
linux 常用命令 BlueSkator linux 命令
1.grep 相信这个命令可以说是大家最常用的命令之一了。尤其是查询生产环境的日志，这个命令绝对是必不可少的。但之前总是习惯于使用（grep -n 关键字文件名）查出关键字以及该关键字所在的行数，然后再用（sed -n '100,200p' 文件名），去查出该关键字之后的日志内容。但其实还有更简便的办法，就是用（grep -B n、-A n、-C n 关键
php heredoc原文档和nowdoc语法 dcj3sjt126com PHP heredoc nowdoc
<!doctype html> <html lang="en"> <head> <meta charset="utf-8"> <title>Current To-Do List</title> </head> <body> <?
overflow的属性周华华 JavaScript
<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"> <html xmlns="http://www.w3.org/1999/xhtml&q
《我所了解的Java》——总体目录 g21121 java
准备用一年左右时间写一个系列的文章《我所了解的Java》，目录及内容会不断完善及调整。在编写相关内容时难免出现笔误、代码无法执行、名词理解错误等，请大家及时指出，我会第一时间更正。 &n
[简单]docx4j常用方法小结 53873039oycg docx
本代码基于docx4j-3.2.0，在office word 2007上测试通过。代码如下: import java.io.File; import java.io.FileInputStream; import ja
Spring配置学习云端月影 spring配置
首先来看一个标准的Spring配置文件 applicationContext.xml <?xml version="1.0" encoding="UTF-8"?> <beans xmlns="http://www.springframework.org/schema/beans" xmlns:xsi=&q
Java新手入门的30个基本概念三 aijuans java 新手 java 入门
17.Java中的每一个类都是从Object类扩展而来的。　　18.object类中的equal和toString方法。　　equal用于测试一个对象是否同另一个对象相等。　　toString返回一个代表该对象的字符串,几乎每一个类都会重载该方法,以便返回当前状态的正确表示.(toString 方法是一个很重要的方法)　　 19.通用编程:任何类类型的所有值都可以同object类性的变量来代替。　
《2008 IBM Rational 软件开发高峰论坛会议》小记 antonyup_2006 软件测试敏捷开发项目管理 IBM 活动
我一直想写些总结,用于交流和备忘,然都没提笔,今以一篇参加活动的感受小记开个头,呵呵! 其实参加《2008 IBM Rational 软件开发高峰论坛会议》是9月4号,那天刚好调休.但接着项目颇为忙,所以今天在中秋佳节的假期里整理了下. 参加这次活动是一个朋友给的一个邀请书,才知道有这样的一个活动,虽然现在项目暂时没用到IBM的解决方案,但觉的参与这样一个活动可以拓宽下视野和相关知识.
PL/SQL的过程编程,异常,声明变量,PL/SQL块百合不是茶 PL/SQL的过程编程异常 PL/SQL块声明变量
PL/SQL; 过程; 符号; 变量; PL/SQL块; 输出; 异常; PL/SQL 是过程语言(Procedural Language)与结构化查询语言(SQL)结合而成的编程语言PL/SQL 是对 SQL 的扩展,sql的执行时每次都要写操作
Mockito(三)--完整功能介绍 bijian1013 持续集成 mockito 单元测试
mockito官网：http://code.google.com/p/mockito/，打开documentation可以看到官方最新的文档资料。一.使用mockito验证行为 //首先要import Mockito import static org.mockito.Mockito.*; //mo
精通Oracle10编程SQL(8)使用复合数据类型 bijian1013 oracle 数据库 plsql
/* *使用复合数据类型 */ --PL/SQL记录 --定义PL/SQL记录 --自定义PL/SQL记录 DECLARE TYPE emp_record_type IS RECORD( name emp.ename%TYPE, salary emp.sal%TYPE, dno emp.deptno%TYPE ); emp_
【Linux常用命令一】grep命令 bit1129 Linux常用命令
grep命令格式 grep [option] pattern [file-list] grep命令用于在指定的文件(一个或者多个,file-list)中查找包含模式串(pattern)的行,[option]用于控制grep命令的查找方式。 pattern可以是普通字符串，也可以是正则表达式，当查找的字符串包含正则表达式字符或者特
mybatis3入门学习笔记白糖_ sql ibatis qq jdbc 配置管理
MyBatis 的前身就是iBatis，是一个数据持久层(ORM)框架。 MyBatis 是支持普通 SQL 查询，存储过程和高级映射的优秀持久层框架。MyBatis对JDBC进行了一次很浅的封装。以前也学过iBatis，因为MyBatis是iBatis的升级版本，最初以为改动应该不大，实际结果是MyBatis对配置文件进行了一些大的改动，使整个框架更加方便人性化。
Linux 命令神器：lsof 入门 ronin47 lsof
lsof是系统管理/安全的尤伯工具。我大多数时候用它来从系统获得与网络连接相关的信息，但那只是这个强大而又鲜为人知的应用的第一步。将这个工具称之为lsof真实名副其实，因为它是指“列出打开文件（lists openfiles）”。而有一点要切记，在Unix中一切（包括网络套接口）都是文件。有趣的是，lsof也是有着最多
java实现两个大数相加，可能存在溢出。 bylijinnan java实现
import java.math.BigInteger; import java.util.regex.Matcher; import java.util.regex.Pattern; public class BigIntegerAddition { /** * 题目：java实现两个大数相加，可能存在溢出。 * 如123456789 + 987654321
Kettle学习资料分享，附大神用Kettle的一套流程完成对整个数据库迁移方法 Kai_Ge Kettle
Kettle学习资料分享 Kettle 3.2 使用说明书目录概述..........................................................................................................................................7 1.Kettle 资源库管
[货币与金融]钢之炼金术士 comsci 金融
自古以来,都有一些人在从事炼金术的工作.........但是很少有成功的那么随着人类在理论物理和工程物理上面取得的一些突破性进展...... 炼金术这个古老
Toast原来也可以多样化 dai_lm android toast
Style 1：默认 Toast def = Toast.makeText(this, "default", Toast.LENGTH_SHORT); def.show(); Style 2：顶部显示 Toast top = Toast.makeText(this, "top", Toast.LENGTH_SHORT); t
java数据计算的几种解决方法3 datamachine java hadoop ibatis r-langue r
4、iBatis 简单敏捷因此强大的数据计算层。和Hibernate不同，它鼓励写SQL，所以学习成本最低。同时它用最小的代价实现了计算脚本和JAVA代码的解耦，只用20%的代价就实现了hibernate 80%的功能,没实现的20%是计算脚本和数据库的解耦。复杂计算环境是它的弱项，比如：分布式计算、复杂计算、非数据
向网页中插入透明Flash的方法和技巧 dcj3sjt126com html Web Flash
将 Flash 作品插入网页的时候，我们有时候会需要将它设为透明，有时候我们需要在Flash的背面插入一些漂亮的图片，搭配出漂亮的效果……下面我们介绍一些将Flash插入网页中的一些透明的设置技巧。　　一、Swf透明、无坐标控制　　首先教大家最简单的插入Flash的代码，透明，无坐标控制：　　注意wmode="transparent"是控制Flash是否透明
ios UICollectionView的使用 dcj3sjt126com
UICollectionView的使用有两种方法，一种是继承UICollectionViewController，这个Controller会自带一个UICollectionView；另外一种是作为一个视图放在普通的UIViewController里面。个人更喜欢第二种。下面采用第二种方式简单介绍一下UICollectionView的使用。 1.UIViewController实现委托，代码如
Eos平台java公共逻辑蕃薯耀 Eos平台java公共逻辑 Eos平台 java公共逻辑
Eos平台java公共逻辑 >>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>> 蕃薯耀 2015年6月1日 17:20:4
SpringMVC4零配置--Web上下文配置【MvcConfig】 hanqunfeng springmvc4
与SpringSecurity的配置类似，spring同样为我们提供了一个实现类WebMvcConfigurationSupport和一个注解@EnableWebMvc以帮助我们减少bean的声明。 applicationContext-MvcConfig.xml  <
解决ie和其他浏览器poi下载excel文件名乱码 jackyrong Excel
使用poi,做传统的excel导出，然后想在浏览器中，让用户选择另存为，保存用户下载的xls文件，这个时候，可能的是在ie下出现乱码（ie,9,10,11),但在firefox,chrome下没乱码，因此必须综合判断，编写一个工具类： /** * * @Title: pro
挥洒泪水的青春 lampcy 编程生活程序员
2015年2月28日，我辞职了，离开了相处一年的触控，转过身--挥洒掉泪水，毅然来到了兄弟连，背负着许多的不解、质疑——”你一个零基础、脑子又不聪明的人，还敢跨行业，选择Unity3D？“，”真是不自量力••••••“，”真是初生牛犊不怕虎•••••“，••••••我只是淡淡一笑，拎着行李----坐上了通向挥洒泪水的青春之地——兄弟连！这就是我青春的分割线，不后悔，只会去用泪水浇灌——已经来到
稳增长之中国股市两点意见-----严控做空，建立涨跌停版停牌重组机制 nannan408
对于股市，我们国家的监管还是有点拼的，但始终拼不过飞流直下的恐慌，为什么呢？笔者首先支持股市的监管。对于股市越管越荡的现象，笔者认为首先是做空力量超过了股市自身的升力，并且对于跌停停牌重组的快速反应还没建立好，上市公司对于股价下跌没有很好的利好支撑。我们来看美国和香港是怎么应对股灾的。美国是靠禁止重要股票做空，在
动态设置iframe高度(iframe高度自适应) Rainbow702 JavaScript iframe contentDocument 高度自适应局部刷新
如果需要对画面中的部分区域作局部刷新，大家可能都会想到使用ajax。但有些情况下，须使用在页面中嵌入一个iframe来作局部刷新。对于使用iframe的情况，发现有一个问题，就是iframe中的页面的高度可能会很高，但是外面页面并不会被iframe内部页面给撑开，如下面的结构： <div id="content"> <div id=&quo
用Rapael做图表 tntxia rap
function drawReport(paper,attr,data){ var width = attr.width; var height = attr.height; var max = 0; &nbs
HTML5 bootstrap2网页兼容（支持IE10以下） xiaoluode html5 bootstrap
<!DOCTYPE html> <html> <head lang="zh-CN"> <meta charset="UTF-8"> <meta http-equiv="X-UA-Compatible" content="IE=edge">

用Tensorflow实现CNN文本分类(详细解释及TextCNN代码解释)

你可能感兴趣的:(Deep,Learning)