SegmentReader 批量 dump

/**

 * Licensed to the Apache Software Foundation (ASF) under one or more

 * contributor license agreements.  See the NOTICE file distributed with

 * this work for additional information regarding copyright ownership.

 * The ASF licenses this file to You under the Apache License, Version 2.0

 * (the "License"); you may not use this file except in compliance with

 * the License.  You may obtain a copy of the License at

 *

 *     http://www.apache.org/licenses/LICENSE-2.0

 *

 * Unless required by applicable law or agreed to in writing, software

 * distributed under the License is distributed on an "AS IS" BASIS,

 * WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or implied.

 * See the License for the specific language governing permissions and

 * limitations under the License.

 */

package org.apache.nutch.segment;



import java.io.BufferedReader;

import java.io.BufferedWriter;

import java.io.File;

import java.io.IOException;

import java.io.InputStreamReader;

import java.io.OutputStreamWriter;

import java.io.PrintStream;

import java.io.PrintWriter;

import java.io.Writer;

import java.text.SimpleDateFormat;

import java.util.ArrayList;

import java.util.Arrays;

import java.util.Date;

import java.util.HashMap;

import java.util.Iterator;

import java.util.List;

import java.util.Map;



import org.apache.commons.logging.Log;

import org.apache.commons.logging.LogFactory;

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.conf.Configured;

import org.apache.hadoop.fs.FileStatus;

import org.apache.hadoop.fs.FileSystem;

import org.apache.hadoop.fs.Path;

import org.apache.hadoop.io.MapFile;

import org.apache.hadoop.io.SequenceFile;

import org.apache.hadoop.io.Text;

import org.apache.hadoop.io.UTF8;

import org.apache.hadoop.io.Writable;

import org.apache.hadoop.io.WritableComparable;

import org.apache.hadoop.mapred.FileInputFormat;

import org.apache.hadoop.mapred.FileOutputFormat;

import org.apache.hadoop.mapred.JobClient;

import org.apache.hadoop.mapred.JobConf;

import org.apache.hadoop.mapred.MapFileOutputFormat;

import org.apache.hadoop.mapred.MapReduceBase;

import org.apache.hadoop.mapred.Mapper;

import org.apache.hadoop.mapred.OutputCollector;

import org.apache.hadoop.mapred.RecordWriter;

import org.apache.hadoop.mapred.Reducer;

import org.apache.hadoop.mapred.Reporter;

import org.apache.hadoop.mapred.SequenceFileInputFormat;

import org.apache.hadoop.mapred.SequenceFileOutputFormat;

import org.apache.hadoop.util.Progressable;

import org.apache.nutch.crawl.CrawlDatum;

import org.apache.nutch.crawl.NutchWritable;

import org.apache.nutch.parse.ParseData;

import org.apache.nutch.parse.ParseText;

import org.apache.nutch.protocol.Content;

import org.apache.nutch.util.HadoopFSUtil;

import org.apache.nutch.util.LogUtil;

import org.apache.nutch.util.NutchConfiguration;

import org.apache.nutch.util.NutchJob;



/** Dump the content of a segment. */

public class SegmentReader extends Configured implements

    Reducer<Text, NutchWritable, Text, Text> {



  public static final Log LOG = LogFactory.getLog(SegmentReader.class);



  long recNo = 0L;

  

  private boolean co, fe, ge, pa, pd, pt;

  private FileSystem fs;



  public static class InputCompatMapper extends MapReduceBase implements

      Mapper<WritableComparable, Writable, Text, NutchWritable> {

    private Text newKey = new Text();



    public void map(WritableComparable key, Writable value,

        OutputCollector<Text, NutchWritable> collector, Reporter reporter) throws IOException {

      // convert on the fly from old formats with UTF8 keys

      if (key instanceof UTF8) {

        newKey.set(key.toString());

        key = newKey;

      }

      collector.collect((Text)key, new NutchWritable(value));

    }

    

  }



  /** Implements a text output format */

  public static class TextOutputFormat extends

      FileOutputFormat<WritableComparable, Writable> {

    public RecordWriter<WritableComparable, Writable> getRecordWriter(

        final FileSystem fs, JobConf job,

        String name, final Progressable progress) throws IOException {



      final Path segmentDumpFile = new Path(FileOutputFormat.getOutputPath(job), name);



      // Get the old copy out of the way

      if (fs.exists(segmentDumpFile)) fs.delete(segmentDumpFile, true);



      final PrintStream printStream = new PrintStream(fs.create(segmentDumpFile));

      return new RecordWriter<WritableComparable, Writable>() {

        public synchronized void write(WritableComparable key, Writable value) throws IOException {

          printStream.println(value);

        }



        public synchronized void close(Reporter reporter) throws IOException {

          printStream.close();

        }

      };

    }

  }



  public SegmentReader() {

    super(null);

  }

  

  public SegmentReader(Configuration conf, boolean co, boolean fe, boolean ge, boolean pa,

          boolean pd, boolean pt) {

    super(conf);

    this.co = co;

    this.fe = fe;

    this.ge = ge;

    this.pa = pa;

    this.pd = pd;

    this.pt = pt;

    try {

      this.fs = FileSystem.get(getConf());

    } catch (IOException e) {

      e.printStackTrace(LogUtil.getWarnStream(LOG));

    }

  }



  public void configure(JobConf job) {

    setConf(job);

    this.co = getConf().getBoolean("segment.reader.co", true);

    this.fe = getConf().getBoolean("segment.reader.fe", true);

    this.ge = getConf().getBoolean("segment.reader.ge", true);

    this.pa = getConf().getBoolean("segment.reader.pa", true);

    this.pd = getConf().getBoolean("segment.reader.pd", true);

    this.pt = getConf().getBoolean("segment.reader.pt", true);

    try {

      this.fs = FileSystem.get(getConf());

    } catch (IOException e) {

      e.printStackTrace(LogUtil.getWarnStream(LOG));

    }

  }



  private JobConf createJobConf() {

    JobConf job = new NutchJob(getConf());

    job.setBoolean("segment.reader.co", this.co);

    job.setBoolean("segment.reader.fe", this.fe);

    job.setBoolean("segment.reader.ge", this.ge);

    job.setBoolean("segment.reader.pa", this.pa);

    job.setBoolean("segment.reader.pd", this.pd);

    job.setBoolean("segment.reader.pt", this.pt);

    return job;

  }

  

  public void close() {}



  public void reduce(Text key, Iterator<NutchWritable> values,

      OutputCollector<Text, Text> output, Reporter reporter)

          throws IOException {

    StringBuffer dump = new StringBuffer();



    dump.append("\nRecno:: ").append(recNo++).append("\n");

    dump.append("URL:: " + key.toString() + "\n");

    recNo++;

    while (values.hasNext()) {

      Writable value = values.next().get(); // unwrap

      if (value instanceof CrawlDatum) {

        dump.append("\nCrawlDatum::\n").append(((CrawlDatum) value).toString());

      } else if (value instanceof Content) {        

        Content c= (Content) value;

        String encoding=c.getMetadata().get("charset");

        if(null==encoding){

            System.out.println("encoding is null, set default encoding UTF-8 !");

            encoding="GBK";

        }    

        dump.append("\nContent::\n").append(c.toString(encoding));

      } else if (value instanceof ParseData) {

        dump.append("\nParseData::\n").append(((ParseData) value).toString());

      } else if (value instanceof ParseText) {

        dump.append("\nParseText::\n").append(((ParseText) value).toString());

      } else if (LOG.isWarnEnabled()) {

        LOG.warn("Unrecognized type: " + value.getClass());

      }

    }

    output.collect(key, new Text(dump.toString()));

  }



  public void dump(Path segment, Path output) throws IOException {

    

      /*批量dump--20121203*/

      /*2号位置开始*/

     /*原因 文件夹路径过长

      *  if (LOG.isInfoEnabled()) {

      LOG.info("SegmentReader: dump segment: " + segment);

    }*/

      /*2号位置开始*/



    JobConf job = createJobConf();

    job.setJobName("read " + segment);



    if (ge) FileInputFormat.addInputPath(job, new Path(segment, CrawlDatum.GENERATE_DIR_NAME));

    if (fe) FileInputFormat.addInputPath(job, new Path(segment, CrawlDatum.FETCH_DIR_NAME));

    if (pa) FileInputFormat.addInputPath(job, new Path(segment, CrawlDatum.PARSE_DIR_NAME));

    if (co) FileInputFormat.addInputPath(job, new Path(segment, Content.DIR_NAME));

    if (pd) FileInputFormat.addInputPath(job, new Path(segment, ParseData.DIR_NAME));

    if (pt) FileInputFormat.addInputPath(job, new Path(segment, ParseText.DIR_NAME));



    job.setInputFormat(SequenceFileInputFormat.class);

    job.setMapperClass(InputCompatMapper.class);

    job.setReducerClass(SegmentReader.class);



    Path tempDir = new Path(job.get("hadoop.tmp.dir", "/tmp") + "/segread-" + new java.util.Random().nextInt());

    fs.delete(tempDir, true);

    

    FileOutputFormat.setOutputPath(job, tempDir);

    job.setOutputFormat(TextOutputFormat.class);

    job.setOutputKeyClass(Text.class);

    job.setOutputValueClass(NutchWritable.class);



    JobClient.runJob(job);



    // concatenate the output

    Path dumpFile = new Path(output, job.get("segment.dump.dir", "dump"));



    // remove the old file

    fs.delete(dumpFile, true);

    FileStatus[] fstats = fs.listStatus(tempDir, HadoopFSUtil.getPassAllFilter());

    Path[] files = HadoopFSUtil.getPaths(fstats);



    PrintWriter writer = null;

    int currentRecordNumber = 0;

    if (files.length > 0) {

      writer = new PrintWriter(new BufferedWriter(new OutputStreamWriter(fs.create(dumpFile),"UTF-8")));

      try {

        for (int i = 0; i < files.length; i++) {

          Path partFile = (Path) files[i];

          try {

            currentRecordNumber = append(fs, job, partFile, writer, currentRecordNumber);

          } catch (IOException exception) {

            if (LOG.isWarnEnabled()) {

              LOG.warn("Couldn't copy the content of " + partFile.toString() +

                       " into " + dumpFile.toString());

              LOG.warn(exception.getMessage());

            }

          }

        }

      } finally {

        writer.close();

      }

    }

    fs.delete(tempDir);

    if (LOG.isInfoEnabled()) { LOG.info("SegmentReader: done"); }

  }



  /** Appends two files and updates the Recno counter */

  private int append(FileSystem fs, Configuration conf, Path src, PrintWriter writer, int currentRecordNumber)

          throws IOException {

    BufferedReader reader = new BufferedReader(new InputStreamReader(fs.open(src)));

    try {

      String line = reader.readLine();

      while (line != null) {

        if (line.startsWith("Recno:: ")) {

          line = "Recno:: " + currentRecordNumber++;

        }

        writer.println(line);

        line = reader.readLine();

      }

      return currentRecordNumber;

    } finally {

      reader.close();

    }

  }



  private static final String[][] keys = new String[][] {

          {"co", "Content::\n"},

          {"ge", "Crawl Generate::\n"},

          {"fe", "Crawl Fetch::\n"},

          {"pa", "Crawl Parse::\n"},

          {"pd", "ParseData::\n"},

          {"pt", "ParseText::\n"}

  };



  public void get(final Path segment, final Text key, Writer writer,

          final Map<String, List<Writable>> results) throws Exception {

    LOG.info("SegmentReader: get '" + key + "'");

    ArrayList<Thread> threads = new ArrayList<Thread>();

    if (co) threads.add(new Thread() {

      public void run() {

        try {

          List<Writable> res = getMapRecords(new Path(segment, Content.DIR_NAME), key);

          results.put("co", res);

        } catch (Exception e) {

          e.printStackTrace(LogUtil.getWarnStream(LOG));

        }

      }

    });

    if (fe) threads.add(new Thread() {

      public void run() {

        try {

          List<Writable> res = getMapRecords(new Path(segment, CrawlDatum.FETCH_DIR_NAME), key);

          results.put("fe", res);

        } catch (Exception e) {

          e.printStackTrace(LogUtil.getWarnStream(LOG));

        }

      }

    });

    if (ge) threads.add(new Thread() {

      public void run() {

        try {

          List<Writable> res = getSeqRecords(new Path(segment, CrawlDatum.GENERATE_DIR_NAME), key);

          results.put("ge", res);

        } catch (Exception e) {

          e.printStackTrace(LogUtil.getWarnStream(LOG));

        }

      }

    });

    if (pa) threads.add(new Thread() {

      public void run() {

        try {

          List<Writable> res = getSeqRecords(new Path(segment, CrawlDatum.PARSE_DIR_NAME), key);

          results.put("pa", res);

        } catch (Exception e) {

          e.printStackTrace(LogUtil.getWarnStream(LOG));

        }

      }

    });

    if (pd) threads.add(new Thread() {

      public void run() {

        try {

          List<Writable> res = getMapRecords(new Path(segment, ParseData.DIR_NAME), key);

          results.put("pd", res);

        } catch (Exception e) {

          e.printStackTrace(LogUtil.getWarnStream(LOG));

        }

      }

    });

    if (pt) threads.add(new Thread() {

      public void run() {

        try {

          List<Writable> res = getMapRecords(new Path(segment, ParseText.DIR_NAME), key);

          results.put("pt", res);

        } catch (Exception e) {

          e.printStackTrace(LogUtil.getWarnStream(LOG));

        }

      }

    });

    Iterator<Thread> it = threads.iterator();

    while (it.hasNext()) it.next().start();

    int cnt;

    do {

      cnt = 0;

      try {

        Thread.sleep(5000);

      } catch (Exception e) {};

      it = threads.iterator();

      while (it.hasNext()) {

        if (it.next().isAlive()) cnt++;

      }

      if ((cnt > 0) && (LOG.isDebugEnabled())) {

        LOG.debug("(" + cnt + " to retrieve)");

      }

    } while (cnt > 0);

    for (int i = 0; i < keys.length; i++) {

      List<Writable> res = results.get(keys[i][0]);

      if (res != null && res.size() > 0) {

        for (int k = 0; k < res.size(); k++) {

          writer.write(keys[i][1]);

          writer.write(res.get(k) + "\n");

        }

      }

      writer.flush();

    }

  }

  

  private List<Writable> getMapRecords(Path dir, Text key) throws Exception {

    MapFile.Reader[] readers = MapFileOutputFormat.getReaders(fs, dir, getConf());

    ArrayList<Writable> res = new ArrayList<Writable>();

    Class keyClass = readers[0].getKeyClass();

    Class valueClass = readers[0].getValueClass();

    if (!keyClass.getName().equals("org.apache.hadoop.io.Text"))

      throw new IOException("Incompatible key (" + keyClass.getName() + ")");

    Writable value = (Writable)valueClass.newInstance();

    // we don't know the partitioning schema

    for (int i = 0; i < readers.length; i++) {

      if (readers[i].get(key, value) != null)

        res.add(value);

      readers[i].close();

    }

    return res;

  }



  private List<Writable> getSeqRecords(Path dir, Text key) throws Exception {

    SequenceFile.Reader[] readers = SequenceFileOutputFormat.getReaders(getConf(), dir);

    ArrayList<Writable> res = new ArrayList<Writable>();

    Class keyClass = readers[0].getKeyClass();

    Class valueClass = readers[0].getValueClass();

    if (!keyClass.getName().equals("org.apache.hadoop.io.Text"))

      throw new IOException("Incompatible key (" + keyClass.getName() + ")");

    Writable aKey = (Writable)keyClass.newInstance();

    Writable value = (Writable)valueClass.newInstance();

    for (int i = 0; i < readers.length; i++) {

      while (readers[i].next(aKey, value)) {

        if (aKey.equals(key))

          res.add(value);

      }

      readers[i].close();

    }

    return res;

  }



  public static class SegmentReaderStats {

    public long start = -1L;

    public long end = -1L;

    public long generated = -1L;

    public long fetched = -1L;

    public long fetchErrors = -1L;

    public long parsed = -1L;

    public long parseErrors = -1L;

  }

  

  SimpleDateFormat sdf = new SimpleDateFormat("yyyy-MM-dd'T'HH:mm:ss");

  

  public void list(List<Path> dirs, Writer writer) throws Exception {

    writer.write("NAME\t\tGENERATED\tFETCHER START\t\tFETCHER END\t\tFETCHED\tPARSED\n");

    for (int i = 0; i < dirs.size(); i++) {

      Path dir = dirs.get(i);

      SegmentReaderStats stats = new SegmentReaderStats();

      getStats(dir, stats);

      writer.write(dir.getName() + "\t");

      if (stats.generated == -1) writer.write("?");

      else writer.write(stats.generated + "");

      writer.write("\t\t");

      if (stats.start == -1) writer.write("?\t");

      else writer.write(sdf.format(new Date(stats.start)));

      writer.write("\t");

      if (stats.end == -1) writer.write("?");

      else writer.write(sdf.format(new Date(stats.end)));

      writer.write("\t");

      if (stats.fetched == -1) writer.write("?");

      else writer.write(stats.fetched + "");

      writer.write("\t");

      if (stats.parsed == -1) writer.write("?");

      else writer.write(stats.parsed + "");

      writer.write("\n");

      writer.flush();

    }

  }

  

  public void getStats(Path segment, final SegmentReaderStats stats) throws Exception {

    SequenceFile.Reader[] readers = SequenceFileOutputFormat.getReaders(getConf(), new Path(segment, CrawlDatum.GENERATE_DIR_NAME));

    long cnt = 0L;

    Text key = new Text();

    for (int i = 0; i < readers.length; i++) {

      while (readers[i].next(key)) cnt++;

      readers[i].close();

    }

    stats.generated = cnt;

    Path fetchDir = new Path(segment, CrawlDatum.FETCH_DIR_NAME);

    if (fs.exists(fetchDir) && fs.getFileStatus(fetchDir).isDir()) {

      cnt = 0L;

      long start = Long.MAX_VALUE;

      long end = Long.MIN_VALUE;

      CrawlDatum value = new CrawlDatum();

      MapFile.Reader[] mreaders = MapFileOutputFormat.getReaders(fs, fetchDir, getConf());

      for (int i = 0; i < mreaders.length; i++) {

        while (mreaders[i].next(key, value)) {

          cnt++;

          if (value.getFetchTime() < start) start = value.getFetchTime();

          if (value.getFetchTime() > end) end = value.getFetchTime();

        }

        mreaders[i].close();

      }

      stats.start = start;

      stats.end = end;

      stats.fetched = cnt;

    }

    Path parseDir = new Path(segment, ParseData.DIR_NAME);

    if (fs.exists(fetchDir) && fs.getFileStatus(fetchDir).isDir()) {

      cnt = 0L;

      long errors = 0L;

      ParseData value = new ParseData();

      MapFile.Reader[] mreaders = MapFileOutputFormat.getReaders(fs, parseDir, getConf());

      for (int i = 0; i < mreaders.length; i++) {

        while (mreaders[i].next(key, value)) {

          cnt++;

          if (!value.getStatus().isSuccess()) errors++;

        }

        mreaders[i].close();

      }

      stats.parsed = cnt;

      stats.parseErrors = errors;

    }

  }

  

  private static final int MODE_DUMP = 0;



  private static final int MODE_LIST = 1;



  private static final int MODE_GET = 2;



 

  public static void main(String[] args) throws Exception {

    if (args.length < 2) {

      usage();

      return;

    }

    int mode = -1;

    if (args[0].equals("-dump"))

      mode = MODE_DUMP;

    else if (args[0].equals("-list"))

      mode = MODE_LIST;

    else if (args[0].equals("-get")) mode = MODE_GET;



    boolean co = true;

    boolean fe = true;

    boolean ge = true;

    boolean pa = true;

    boolean pd = true;

    boolean pt = true;

    // collect general options

    for (int i = 1; i < args.length; i++) {

      if (args[i].equals("-nocontent")) {

        co = false;

        args[i] = null;

      } else if (args[i].equals("-nofetch")) {

        fe = false;

        args[i] = null;

      } else if (args[i].equals("-nogenerate")) {

        ge = false;

        args[i] = null;

      } else if (args[i].equals("-noparse")) {

        pa = false;

        args[i] = null;

      } else if (args[i].equals("-noparsedata")) {

        pd = false;

        args[i] = null;

      } else if (args[i].equals("-noparsetext")) {

        pt = false;

        args[i] = null;

      }

    }

    Configuration conf = NutchConfiguration.create();

    final FileSystem fs = FileSystem.get(conf);

    SegmentReader segmentReader = new SegmentReader(conf, co, fe, ge, pa, pd, pt);

    // collect required args

    switch (mode) {

      case MODE_DUMP:

        String input = args[1];

        if (input == null) {

          System.err.println("Missing required argument: <segment_dir>");

          usage();

          return;

        }

        String output = args.length > 2 ? args[2] : null;

        if (output == null) {

          System.err.println("Missing required argument: <output>");

          usage();

          return;

        }

        

        /*批量dump--20121203*/

        /*1号位置开始*/

        File fInput=new File(input);

        File[] filesSeg=fInput.listFiles();

        for (File inseg : filesSeg) {

            String seg=inseg.getName();

            LOG.info(seg);

            File ouseg=new File(output,seg);

            if(!ouseg.exists()){

                ouseg.mkdir();

            }

            segmentReader.dump(new Path(inseg.getAbsolutePath()), new Path(ouseg.getAbsolutePath()));            

        }

        

        /*代码*/

        //segmentReader.dump(new Path(input), new Path(output));//原来的代码

        /*1号位置结束*/

        

        return;

      case MODE_LIST:

        ArrayList<Path> dirs = new ArrayList<Path>();

        for (int i = 1; i < args.length; i++) {

          if (args[i] == null) continue;

          if (args[i].equals("-dir")) {

            Path dir = new Path(args[++i]);

            FileStatus[] fstats = fs.listStatus(dir, HadoopFSUtil.getPassDirectoriesFilter(fs));

            Path[] files = HadoopFSUtil.getPaths(fstats);

            if (files != null && files.length > 0) {

              dirs.addAll(Arrays.asList(files));

            }

          } else dirs.add(new Path(args[i]));

        }

        segmentReader.list(dirs, new OutputStreamWriter(System.out, "UTF-8"));

        return;

      case MODE_GET:

        input = args[1];

        if (input == null) {

          System.err.println("Missing required argument: <segment_dir>");

          usage();

          return;

        }

        String key = args.length > 2 ? args[2] : null;

        if (key == null) {

          System.err.println("Missing required argument: <keyValue>");

          usage();

          return;

        }

        segmentReader.get(new Path(input), new Text(key), new OutputStreamWriter(System.out, "UTF-8"), new HashMap<String, List<Writable>>());

        return;

      default:

        System.err.println("Invalid operation: " + args[0]);

        usage();

        return;

    }

  }



  private static void usage() {

    System.err.println("Usage: SegmentReader (-dump ... | -list ... | -get ...) [general options]\n");

    System.err.println("* General options:");

    System.err.println("\t-nocontent\tignore content directory");

    System.err.println("\t-nofetch\tignore crawl_fetch directory");

    System.err.println("\t-nogenerate\tignore crawl_generate directory");

    System.err.println("\t-noparse\tignore crawl_parse directory");

    System.err.println("\t-noparsedata\tignore parse_data directory");

    System.err.println("\t-noparsetext\tignore parse_text directory");

    System.err.println();

    System.err.println("* SegmentReader -dump <segment_dir> <output> [general options]");

    System.err.println("  Dumps content of a <segment_dir> as a text file to <output>.\n");

    System.err.println("\t<segment_dir>\tname of the segment directory.");

    System.err.println("\t<output>\tname of the (non-existent) output directory.");

    System.err.println();

    System.err.println("* SegmentReader -list (<segment_dir1> ... | -dir <segments>) [general options]");

    System.err.println("  List a synopsis of segments in specified directories, or all segments in");

    System.err.println("  a directory <segments>, and print it on System.out\n");

    System.err.println("\t<segment_dir1> ...\tlist of segment directories to process");

    System.err.println("\t-dir <segments>\t\tdirectory that contains multiple segments");

    System.err.println();

    System.err.println("* SegmentReader -get <segment_dir> <keyValue> [general options]");

    System.err.println("  Get a specified record from a segment, and print it on System.out.\n");

    System.err.println("\t<segment_dir>\tname of the segment directory.");

    System.err.println("\t<keyValue>\tvalue of the key (url).");

    System.err.println("\t\tNote: put double-quotes around strings with spaces.");

  }

}

使用LLaVa和Ollama实现多模态RAG示例 llzwxh888 python 人工智能开发语言
本文将详细介绍如何使用LLaVa和Ollama实现多模态RAG（检索增强生成），通过提取图像中的结构化数据、生成图像字幕等功能来展示这一技术的强大之处。安装环境首先，您需要安装以下依赖包：!pipinstallllama-index-multi-modal-llms-ollama!pipinstallllama-index-readers-file!pipinstallunstructured!p
【JS】前端文件读取FileReader操作总结程序员-张师傅前端前端 javascript 开发语言
前端文件读取FileReader操作总结FileReader是JavaScript中的一个WebAPI，它允许web应用程序异步读取用户计算机上的文件（或原始数据缓冲区）的内容，例如读取文件以获取其内容，并在不将文件发送到服务器的情况下在客户端使用它。这对于处理图片、文本文件等非常有用，尤其是当你想要在用户界面中即时显示文件内容或进行文件预览时。创建FileReader对象首先，你需要创建一个Fi
C# 多线程操作同一个文件，如何避免冲突 FlYFlOWERANDLEAF c#开发语言
1使用lock经测试，依然存在线程冲突privatestaticobjectlocker=newobject();……lock(locker){stringbText=File.ReadAllText(FPath);returnbText;}……lock(locker){File.WriteAllText(FPath,aContent);}2使用ReaderWriterLockSlim经测试，依然
java读取csv文件 c++代码诗人 java与net windows python 开发语言
importjava.io.BufferedReader;importjava.io.FileInputStream;importjava.io.IOException;importjava.io.InputStreamReader;importjava.util.ArrayList;importjava.util.List;importjava.util.regex.Matcher;import
excel表格解析数据摸鱼的张三 excel java 前端
varpersons=[];functionexcelChange(e){varfiles=e.filesvarfileReader=newFileReader();fileReader.onload=function(ev){console.log(ev);vardata=ev.target.resultvarworkbook=XLSX.read(data,{type:'binary'})var
【JAVA入门】Day42 - 转换流 Clown Piece JAVA入门 java python 开发语言
【JAVA入门】Day42-转换流文章目录【JAVA入门】Day42-转换流转换流是字符流和字节流之间的桥梁。转换流中的输入流叫做InputStreamReader，它可以把字节流转换为字符流。转换流的输出流叫做OutputStreamWriter，它可以把字符流转换成字节流。【使用例1】把一个GBK的文件中的中文读取到内存中，不能出现乱码。（作用1：按照指定的字符集读取数据）packageCon
前端有关文件上传下载操作发呆小天才yy 前端 javascript
文件上传文件上传有两种形式（传给后端的文件形式）变成blob通过formData搭载传输（二进制blob传输）转为base64直接传输(简便，但是后端需要解码，时间长)，通过fileReader搭载相关对象：files（blob的一个子类）：通过input标签读取过来的文件对象（属于前端的方法，没办法直接传给后端）blob:不可变的二进制内容，包含很多操作方法（newBlob([file])直接将
Java学习Day12------字符流、字符缓冲流、转换流、对象操作流程挨踢农民工dsh JavaSE学习 java
字符流、字符缓冲流、转换流、对象操作流程字符流FileWriterFileReader字符缓冲流转换流对象操作流字符流（1）概述：采用字节流读取数据的时候，容易出现乱码问题，这个时候就需要使用字节流而不是字符流（字节流一次只能读取一个字节,无法确定码表的情况下,转换的过程当中，就会出现乱码，GBK是两个字节进行转换，UTF-8是三个字节进行转换）（2）常见的编码表 a)ASCII码表 b)GB
vue 预览 word_vue预览word 2401_84437530 程序员 vue.js word 前端
//将file转为bufferletfr=newFileReader();fr.readAsArrayBuffer(content.file);fr.addEventListener("loadend",(e)=>{console.log("loadend---->",e)letbuffer=e.target.result;this.docxRender(buffer);},false);}//"
Java API 之文件(File) && 异常(Exception)详解艾伦~耶格尔 Java初级 java 开发语言学习
下面介绍两个关于Java的API的使用，分别是文件(File)、异常(Exception)一、文件（File）1.读取文件使用BufferedReader和FileReader示例代码：importjava.io.BufferedReader;importjava.io.FileReader;importjava.io.IOException;publicclassReadFileExample{
获取视频长度 AI算法网奇 python基础 python 开发语言
fromdecordimportVideoReadersys.path.insert(0,'/home/model-server/dev/data_platform/processors')fromaestheticimportget_aesthetic_model,get_aesthetic_score_batch_queuefrommytools.utilsimportprint_with_t
.Net/C#读取CAD软件dwg、dxf数据表实体 WineMonk .NET .net c#
.Net/C#读取CAD软件dwg、dxf数据表实体使用ACadSharp库读取CAD软件dwg数据表实体文末附ACadSharp.dll库文件及源码CadDocReaderusingACadSharp;usingACadSharp.Entities;usingACadSharp.IO;usingCSMath;usingSystem.Text.RegularExpressions;namespac
将input type=file 获取到的图片展示到页面上不会做饭的程序员 JS js
我们创建一个函数，用于接收拿到的files[0]，并将生成的base64地址返回出去getBase64(file){returnnewPromise(function(resolve,reject){letreader=newFileReader();letimgResult="";reader.readAsDataURL(file);reader.onload=function(){imgRes
极简代码，30秒解决：python读取青藏高原shp文件并画图葉读春秋 python
地学/气象学学子在画欧亚范围的图时，常常需要加载青藏高原。那在python画图中如何加载青藏高原呢？假设已经有了青藏高原的shp文件，放在D盘的shp文件夹中，命名为x.shp。那么接下来，只要importcartopyimportcartopy.crsasccrs然后#加载青藏高原reader=cartopy.io.shapereader.Reader('D:\shp\x.shp')provin
python 基于shp文件绘制完整中国地图（matplotlib,cartopy) 水猪1 python matplotlib
思路：中国地图画两遍，截取响相应经纬度范围的区域难点：中国海岸线以及南海岛屿等数据的准确性解决思路：在阿里云上获取中国地图的json文件，离线转成shp文件（网上有教程，也可留言获取）效果图：importmatplotlib.pyplotaspltimportcartopy.crsasccrsfromcartopy.ioimportshapereaderimportcartopy.featurea
前端图片转Base64编码 _耀北前端
在前端将图片转为Base64编码，通常会通过使用JavaScript的FileReader对象。效果图代码步骤说明：1.用户通过文件输入框选择图片。2.FileReader对象读取图片，并将其转为Base64编码。3.读取完成后，图片通过img标签预览，Base64编码会显示在页面上。4.复制按钮：在页面中添加了一个按钮，当图片被加载并生成Base64编码后，按钮会显示出来。5.Clipboard
从文本坐标数据转换为矢量（点线面）天南地北飞 fme学习学习
从坐标数据转换为空间几何（点线面）介绍只要文件中包含空间数据（如经纬度信息），转换为点、线或面要素。我们将使用内置的excelReader参数、VertexCreator转换器将坐标转换为点要素。我们还将使用VertexCreator转换器和LineBuilder转换器和AreaBuilder转换为线和面要素。对于任何纬度/纬度的的数据集，都可以这么搞。模板总体结构截取了我的模板的部分内容，爬取了
JsonCpp源码分析——Reader 哎呦，帅小伙哦 #jsoncpp json
1、与Writer模块功能相反，可以将Reader理解成一个反序列化的工具，Writer的作用主要是将Value对象转成string或者流式的结构，Reader的作用主要是将流式的结构转成Value类型的对象。Reader类的主要职责有3个，解析JSON字符串：将JSON格式的字符串读取并解析成相应的C++数据结构。处理不同的数据类型，支持解析JSON对象、数组、字符串、数字、布尔值和null。处
用正则表达式过滤logcat中的多个tag的日志 fc82bb084ee7
在AndroidStudio中,在过滤器的byLogTag选项中配置.我配置了2个tagfilter方便开发,1.multi-tag-filter2.ignore-multi-tag-filter.过滤出指定tag的日志信息^(?:Watchdog|InputReader|ahking)Watchdog忽略指定tag的日志信息^(?!WifiMonitor|WifiHW)有些tag的无用log非常
【Python】文件读写（CSV、Excel）素颜清风宛如月 Python python
一、CSV文件1读csv文件1.1以数组方式读文件deflistReader():withopen("user.csv",encoding="UTF-8")ascsvFile:#读文件csvData=csv.reader(csvFile)#数据集合print(list(csvData))#遍历数据对象fordataincsvData:#csvData.line_num：每条数据的行号print("
python中csv文件的详细操作 GY-1997 python笔记 python 开发语言
在Python中，可以使用内置的csv模块来操作CSV文件。以下是一些常见的CSV文件操作示例：1.读取CSV文件：importcsvwithopen('file.csv','r')asfile:reader=csv.reader(file)forrowinreader:print(row)2.写入CSV文件：importcsvdata=[['Name','Age','City'],['John'
Java中的IO流详解 Bro_cat Java java 开发语言
Java的输入输出（IO）流是处理数据读写的基础。它们允许程序与外部设备（如文件、网络等）进行数据交互。Java中的IO流主要分为字节流和字符流，每种流都有其特定的用途和类结构。IO流的基本概念IO流是Java提供的一种用于处理输入输出的机制。它提供了一种统一的方式来处理不同类型的输入输出设备。输入流（InputStream/Reader）：用于从外部设备读取数据到程序中。输出流（OutputSt
spring启动的流程图简书徐小耳
spring启动.png分析三个步骤创建容器1.设置reader，scanner，beanFactory准备容器一、设置context的environment二、如果存在开发主动设置的beanNameGenerator，resourceLoader就替换原有的这两个属性三、设置ContextInitializerDelegatingApplicationContextInitializer-1.获
Java高级编程—I/O流（包括字节输入流、字节输出流、字符输出流、字符输入流、缓冲流、序列化流、反序列化流等，详解附有代码＋案例）蔚一 Java知识 java 开发语言算法 intellij-idea
文章目录二十七.I/O流27.1概述27.2分类27.3字节输出流27.3.1数据写入本地文件27.3.2换行、续写27.4字节输入流27.4.1读取数据到程序27.4.2循环读取27.4.3拷贝数据27.4.4一次读取多个27.6字符输入流27.6.1FileReader的使用27.7字符输出流27.8.缓冲流27.8.1字节缓冲流27.8.1.1拷贝文件(一)27.8.1.2拷贝文件(二)27
POST请求传入中文参数，接收端乱码常敲代码手不生 IDEA学习与实践
问题描述：通过post请求调试短信接口发送出去后，客户端无法收到短信，中文内容乱码追踪过程：接口采用post请求进行，无法收取短信的接口代码如下：publicstaticStringsendPost(Stringurl,MapparamMap){PrintWriterout=null;BufferedReaderin=null;Stringresult="";try{URLrealUrl=newU
CPR曲面重建代码 peanut_wu 算法
废话不说，直接上代码：#include"vtkAutoInit.h"#include"vtkPolyData.h"#include"vtkProbeFilter.h"#include"vtkParametricFunctionSource.h"#include"vtkParametricSpline.h"#include"vtkDICOMImageReader.h"#include"vtkPoin
【Day09-练习】完球了 java 开发语言学习
1.1字符流利用字符流将一个文本文件复制到E:盘下，例如：D:/1.txt复制到E:/2.txt请使用字符流：FileReader和FileWriter实现publicclassTest1{publicstaticvoidmain(String[]args)throwsException{try(FileReaderreader=newFileReader("D:/1.txt");FileWrit
3月作业雨点评摘要杨蓉
@文晨｜15437｜北京https://www.jianshu.com/p/97da60f356d7?utm_campaign=hugo&utm_medium=reader_share&utm_content=note&utm_source=weixin-timeline《深海，打开生命的总开关》【见】看完战友文章，敬佩感油然而生，好奇地问一下：战友是持证潜水员呀？【感】感觉作者思绪在书中和现实中
python读取csv指定列_使用python读取csv中的特定列高晖云 python读取csv指定列
defread_csv(file,columns,type_name="Row"):try:row_type=namedtuple(type_name,columns)exceptValueError:row_type=tuplerows=iter(csv.reader(file))header=rows.next()mapping=[header.index(x)forxincolumns]fo
python获取csv文本的某行或某列数据 weixin_30746117 python
1#coding='utf-8'23importcsv45#使用list，只能读取列，而且是全文读取,csv.reader会自动把CSV内容生成数组6'''7df=csv.reader(open('F:\c_database\c2015.csv'))8fordataindf:9print(data[3])10'''1112#如果要读取某行，必须将CSV内容生成DICT字典（2维）13withope
apache ftpserver-CentOS config gengzg apache
<server xmlns="http://mina.apache.org/ftpserver/spring/v1" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation=" http://mina.apache.o
优化MySQL数据库性能的八种方法 AILIKES sql mysql
1、选取最适用的字段属性　　MySQL可以很好的支持大数据量的存取，但是一般说来，数据库中的表越小，在它上面执行的查询也就会越快。因此，在创建表的时候，为了获得更好的性能，我们可以将表中字段的宽度设得尽可能小。例如，在定义邮政编码这个字段时，如果将其设置为CHAR(255),显然给数据库增加了不必要的空间，甚至使用VARCHAR这种类型也是多余的，因为CHAR(6)就可以很
JeeSite 企业信息化快速开发平台 Kai_Ge JeeSite
JeeSite 企业信息化快速开发平台平台简介 JeeSite是基于多个优秀的开源项目，高度整合封装而成的高效，高性能，强安全性的开源Java EE快速开发平台。 JeeSite本身是以Spring Framework为核心容器，Spring MVC为模型视图控制器，MyBatis为数据访问层， Apache Shiro为权限授权层，Ehcahe对常用数据进行缓存，Activit为工作流
通过Spring Mail Api发送邮件 120153216 邮件 main
原文地址：http://www.open-open.com/lib/view/open1346857871615.html 使用Java Mail API来发送邮件也很容易实现，但是最近公司一个同事封装的邮件API实在让我无法接受，于是便打算改用Spring Mail API来发送邮件，顺便记录下这篇文章。【Spring Mail API】 Spring Mail API都在org.spri
Pysvn 程序员使用指南 2002wmj SVN
源文件:http://ju.outofmemory.cn/entry/35762 这是一篇关于pysvn模块的指南. 完整和详细的API请参考 http://pysvn.tigris.org/docs/pysvn_prog_ref.html. pysvn是操作Subversion版本控制的Python接口模块. 这个API接口可以管理一个工作副本, 查询档案库, 和同步两个. 该
在SQLSERVER中查找被阻塞和正在被阻塞的SQL 357029540 SQL Server
SELECT R.session_id AS BlockedSessionID , S.session_id AS BlockingSessionID , Q1.text AS Block
Intent 常用的用法备忘 7454103 .net android Google Blog F#
Intent 应该算是Android中特有的东西。你可以在Intent中指定程序要执行的动作（比如：view,edit,dial），以及程序执行到该动作时所需要的资料。都指定好后，只要调用startActivity()，Android系统会自动寻找最符合你指定要求的应用程序，并执行该程序。下面列出几种Intent 的用法显示网页:
Spring定时器时间配置 adminjun spring 时间配置定时器
红圈中的值由6个数字组成，中间用空格分隔。第一个数字表示定时任务执行时间的秒，第二个数字表示分钟，第三个数字表示小时，后面三个数字表示日，月，年，< xmlnamespace prefix ="o" ns ="urn:schemas-microsoft-com:office:office" /> 测试的时候，由于是每天定时执行，所以后面三个数
POJ 2421 Constructing Roads 最小生成树 aijuans 最小生成树
来源：http://poj.org/problem?id=2421 题意：还是给你n个点，然后求最小生成树。特殊之处在于有一些点之间已经连上了边。思路：对于已经有边的点，特殊标记一下，加边的时候把这些边的权值赋值为0即可。这样就可以既保证这些边一定存在，又保证了所求的结果正确。代码： #include <iostream> #include <cstdio>
重构笔记——提取方法（Extract Method） ayaoxinchao java 重构提炼函数局部变量提取方法
提取方法（Extract Method）是最常用的重构手法之一。当看到一个方法过长或者方法很难让人理解其意图的时候，这时候就可以用提取方法这种重构手法。下面是我学习这个重构手法的笔记：提取方法看起来好像仅仅是将被提取方法中的一段代码，放到目标方法中。其实，当方法足够复杂的时候，提取方法也会变得复杂。当然，如果提取方法这种重构手法无法进行时，就可能需要选择其他
为UILabel添加点击事件 bewithme UILabel
默认情况下UILabel是不支持点击事件的，网上查了查居然没有一个是完整的答案，现在我提供一个完整的代码。 UILabel *l = [[UILabel alloc] initWithFrame:CGRectMake(60, 0, listV.frame.size.width - 60, listV.frame.size.height)]
NoSQL数据库之Redis数据库管理(PHP-REDIS实例) bijian1013 redis 数据库 NoSQL
一.redis.php <?php //实例化 $redis = new Redis(); //连接服务器 $redis->connect("localhost"); //授权 $redis->auth("lamplijie"); //相关操
SecureCRT使用备注 bingyingao secureCRT 每页行数
SecureCRT日志和卷屏行数设置一、使用securecrt时，设置自动日志记录功能。 1、在C:\Program Files\SecureCRT\下新建一个文件夹(也就是你的CRT可执行文件的路径），命名为Logs； 2、点击Options -> Global Options -> Default Session -> Edite Default Sett
【Scala九】Scala核心三：泛型 bit1129 scala
泛型类 package spark.examples.scala.generics class GenericClass[K, V](val k: K, val v: V) { def print() { println(k + "," + v) } } object GenericClass { def main(args: Arr
素数与音乐 bookjovi 素数数学 haskell
由于一直在看haskell，不可避免的接触到了很多数学知识，其中数论最多，如素数，斐波那契数列等，很多在学生时代无法理解的数学现在似乎也能领悟到那么一点。闲暇之余，从图书馆找了<<The music of primes>>和<<世界数学通史>>读了几遍。其中素数的音乐这本书与软件界熟知的&l
Java-Collections Framework学习与总结-IdentityHashMap BrokenDreams Collections
这篇总结一下java.util.IdentityHashMap。从类名上可以猜到，这个类本质应该还是一个散列表，只是前面有Identity修饰，是一种特殊的HashMap。简单的说，IdentityHashMap和HashM
读《研磨设计模式》-代码笔记-享元模式-Flyweight bylijinnan java 设计模式
声明：本文只为方便我个人查阅和理解，详细的分析以及源代码请移步原作者的博客http://chjavach.iteye.com/ import java.util.ArrayList; import java.util.Collection; import java.util.HashMap; import java.util.List; import java
PS人像润饰&调色教程集锦 cherishLC PS
1、仿制图章沿轮廓润饰——柔化图像，凸显轮廓 http://www.howzhi.com/course/retouching/ 新建一个透明图层，使用仿制图章不断Alt+鼠标左键选点，设置透明度为21%，大小为修饰区域的1/3左右（比如胳膊宽度的1/3），再沿纹理方向（比如胳膊方向）进行修饰。所有修饰完成后，对该润饰图层添加噪声，噪声大小应该和
更新多个字段的UPDATE语句 crabdave update
更新多个字段的UPDATE语句 update tableA a set (a.v1, a.v2, a.v3, a.v4) = --使用括号确定更新的字段范围
hive实例讲解实现in和not in子句 daizj hive not in in
本文转自：http://www.cnblogs.com/ggjucheng/archive/2013/01/03/2842855.html 当前hive不支持 in或not in 中包含查询子句的语法，所以只能通过left join实现。假设有一个登陆表login(当天登陆记录,只有一个uid),和一个用户注册表regusers(当天注册用户，字段只有一个uid)，这两个表都包含
一道24点的10+种非人类解法（2,3,10,10） dsjt 算法
这是人类算24点的方法？！！！事件缘由：今天晚上突然看到一条24点状态，当时惊为天人，这NM叫人啊？以下是那条状态朱明西 : 24点，算2 3 10 10，我LX炮狗等面对四张牌痛不欲生，结果跑跑同学扫了一眼说，算出来了，2的10次方减10的3次方。。我草这是人类的算24点啊。。然后么。。。我就在深夜很得瑟的问室友求室友算刚出完题，文哥的暴走之旅开始了 5秒后
关于YII的菜单插件 CMenu和面包末breadcrumbs路径管理插件的一些使用问题 dcj3sjt126com yii framework
在使用 YIi的路径管理工具时，发现了一个问题。 <?php
对象与关系之间的矛盾：“阻抗失配”效应[转] come_for_dream 对象
概述 “阻抗失配”这一词组通常用来描述面向对象应用向传统的关系数据库（RDBMS）存放数据时所遇到的数据表述不一致问题。C++程序员已经被这个问题困扰了好多年，而现在的Java程序员和其它面向对象开发人员也对这个问题深感头痛。 “阻抗失配”产生的原因是因为对象模型与关系模型之间缺乏固有的亲合力。“阻抗失配”所带来的问题包括：类的层次关系必须绑定为关系模式（将对象
学习编程那点事 gcq511120594 编程互联网
一年前的夏天，我还在纠结要不要改行，要不要去学php？能学到真本事吗？改行能成功吗？太多的问题，我终于不顾一切，下定决心，辞去了工作，来到传说中的帝都。老师给的乘车方式还算有效，很顺利的就到了学校，赶巧了，正好学校搬到了新校区。先安顿了下来，过了个轻松的周末，第一次到帝都，逛逛吧！接下来的周一，是我噩梦的开始，学习内容对我这个零基础的人来说，除了勉强完成老师布置的作业外，我已经没有时间和精力去
Reverse Linked List II hcx2013 list
Reverse a linked list from position m to n. Do it in-place and in one-pass. For example:Given 1->2->3->4->5->NULL, m = 2 and n = 4, return
Spring4.1新特性——页面自动化测试框架Spring MVC Test HtmlUnit简介 jinnianshilongnian spring 4.1
目录 Spring4.1新特性——综述 Spring4.1新特性——Spring核心部分及其他 Spring4.1新特性——Spring缓存框架增强 Spring4.1新特性——异步调用和事件机制的异常处理 Spring4.1新特性——数据库集成测试脚本初始化 Spring4.1新特性——Spring MVC增强 Spring4.1新特性——页面自动化测试框架Spring MVC T
Hadoop集群工具distcp liyonghui160com
1. 环境描述两个集群：rock 和 stone rock无kerberos权限认证，stone有要求认证。 1. 从rock复制到stone，采用hdfs Hadoop distcp -i hdfs://rock-nn:8020/user/cxz/input hdfs://stone-nn:8020/user/cxz/运行在rock端，即源端问题：报版本
一个备份MySQL数据库的简单Shell脚本 pda158 mysql 脚本
　　主脚本（用于备份mysql数据库）：　　该Shell脚本可以自动备份数据库。只要复制粘贴本脚本到文本编辑器中，输入数据库用户名、密码以及数据库名即可。我备份数据库使用的是mysqlump 命令。后面会对每行脚本命令进行说明。　　 1. 分别建立目录“backup”和“oldbackup” 　　#mkdir /backup 　　#mkdir /oldbackup 　
300个涵盖IT各方面的免费资源（中）——设计与编码篇 shoothao IT资源图标库图片库色彩板字体
A. 免费的设计资源 Freebbble:来自于Dribbble的免费的高质量作品。 Dribbble:Dribbble上“免费”的搜索结果——这是巨大的宝藏。 Graphic Burger:每个像素点都做得很细的绝佳的设计资源。 Pixel Buddha:免费和优质资源的专业社区。 Premium Pixels:为那些有创意的人提供免费的素材。
thrift总结 - 跨语言服务开发 uule thrift
官网官网JAVA例子 thrift入门介绍 IBM-Apache Thrift - 可伸缩的跨语言服务开发框架 Thrift入门及Java实例演示 thrift的使用介绍 RPC POM： <dependency> <groupId>org.apache.thrift</groupId>

SegmentReader 批量 dump

你可能感兴趣的:(reader)