weixin_34310127

找最大重复字串

http://www.chinaunix.net/jh/24/464277.html

http://www.chinaunix.net 作者:bioinfor 发表于：2007-03-27 19:16:25
【发表评论】【查看原文】【Shell讨论区】【关闭】

1) Write a program to identify all the repetitive patterns in a string of
charaters (INPUT). The string is only composed of A,C,G,T characters. The
maximum length of string is 10000. The minimum length of repeat is 10
characters. Output: position, size, and patterns. Here is an example:
1)写一个程序，识别字符串中所有的重复片段(重复模式)，字符串由A，C，G，T组成，字符串最长为10000，随机产生。重复的片段最小是10个符串。输出：位置，大小，和片段。如下：
String:
TAAAAACTCGGGGT AAAAACTCGGGGAAAA
Repeat:
Repeat: AAAAACTCGGGG, Size: 12, Start Positions: 2, 15

解释：如这就就有两个重复(空格格开了)：T AAAAACTCGGGG T AAAAACTCGGGG AAAA
这两个重复位置分别在字符串的2和15位，大小为12

2) Write a program to identify all the INVERTED repetitive patterns (e.g.
TAACCG => GCCAAT) in a string of character (INPUT). The string is only
composed of A,C,G,T characters. The maximum length of string is 10000. The
minimum length of repeat is 10 characters. Output: position, size, and
patterns. Here is an example:

写一个程序识别所有的反向重复，如TAACCG => GCCAAT，也就是前面的反过来就是后面的字符串。和上面一样，字符串最长为10000，随机产生，最小反向重复片段为10，输出位置，大小，和片段，如下：
String:
CAAAAACGAGGGGTTTGGGGAGCAAAAA
Inverted Repeat:
Inverted Repeat: AAAAACGAGGGG, Size: 12, Start Positions: 17, 2

解释：如上面，C AAAAACGAGGGG TTT GGGGAGCAAAAA
AAAAACGAGGGG和GGGGAGCAAAAA分别是反向重复，分别在2和17位上，大小为12。

哈，学生物的吧。去 perl.com 有 total solution, 如 bioperl.

或用 awk 自己写，要讲效率的话，还是 C 好。

lightspeed 回复于：2004-12-12 12:26:33

注意：下面的例子中的 STR_MAX 及 STR_MIN 可根据需要设定。

#!/bin/awk -f
#
# A script can be used to check any repeat pieces of nucleotide sequences.
#
# Design: lighspeed
# Date: Dec. 12, 2004
#
# Usage:: $0 datafile
#
# Variables:
#
# left - a repeat string to be matched
# right - the right side string used to match any left in it
# rev_left - reverse string of left
# rev_right - the right side string used to match any rev_left in it
# flag[position] - an array element which will be set if the string in the position is matched
#

{
L=length($0)
STR_MIN=10
# STR_MAX=int(L / 2)
STR_MAX=20
print "------------------- Line# "NR" --------------------\n"

for ( Str_Len=STR_MIN; Str_Len <= STR_MAX; Str_Len ++ ) {

for ( i in flag )
delete flag

for ( Position=1; Position <= L - 2 * Str_Len + 1; Position ++ ) {

if ( Position in flag )
continue

      count=0
      pos=Position
      offset=Position
      rev_offset=offset
      rev_count=0
      rev_pos=""
      rev_left=""
      left=substr($0,Position,Str_Len)
      if (index(left,"A")==0 || index(left,"C")==0 || index(left,"G")==0 || index(left,"T")==0 )
        continue

right=substr($0, Position + 1)

      for ( i=length(left); i>=1; i-- ) {
        rev_left=rev_left""substr(left,i,1)
      }

rev_right=right

      while ( Str_Len <= length(right) ) {
        i=index(right,left)
        if ( i > 0 ) {
   count ++
          j=offset + i
   pos=pos";"j
          flag[j]=1
          right=substr(right, i + 1)
          offset+=i
        }
        else
          break
      }

      while ( Str_Len <= length(rev_right) ) {
        i=index(rev_right,rev_left)
        if ( i > 0 ) {
   rev_count ++
          j=rev_offset + i
          if ( rev_pos == "" ) {
     rev_pos=j
          }
          else
     rev_pos=rev_pos";"j
          flag[j]=1
          rev_right=substr(rev_right, i + 1)
          rev_offset+=i
        }
        else
          break
      }

if (count > 0 )
match_number[Str_Len] ++

if (rev_count > 0 )
rev_number[Str_Len] ++

      if (count > 0 || rev_count > 0) {
        print left, "Length="Str_Len, "Position="pos, (rev_count >0) ? "Rev_Position="rev_pos : ""
      }

    }
}
print ""
print "Summary of Line# "NR
print "------------------"
   for ( i in match_number ) {
    print "String length :: " i " Matched Strings :: " match_number
    delete match_number
}
print ""
for ( i in rev_number ) {
    print "String length :: " i " Matched Reverse Strings :: " rev_number
    delete rev_number
}

}

数据文件来自 DNA NCBI35 的片段。处理成 10000 个字符的单行文件。

# cat datafile

TAAAATGTGTAATCAACTAATACAAAGCAAGTTTTGTACTTTTTGTTGAATTTATTACTAAGTAT
TCTTTTTGATGCAATTGTAAGTAGAAATATTTATTTATTAAGAGATAGGGTCTTACTGTGTGGCC
CAGTATGGCCTTGAACTCCTGGGCTTAAGACATCCTCCTGCTGCAGCCTCCTGAGTAACTGAGAT
TACAGGTGTGCACCACCTCGCCTGGCTCAGAATGGTTTTCTTAACTTCATTTTTAGATTGTTCAC
TGTGAATATATCGAATTACAATAGTTTAGGCTGGGCATGGTGGCTCACGCCTGTAATCCTAGCAC
TTGGGGAGGCTGAGGTGGGTGGATAACTTGAGGCCAGGAGTTTCAGATCAGCCTGGCCATCACAG
AGAAACCTTGTCTTTACCAAAATCACAACAAATTAATTAGCTGGTTGTGGTGGTGCATGCTTGCA
ATCCCAGCTACTGGGGAGGCTGAGGTACGAGAATTACCTGAACCCAGGAGGTGGAGGTTGCAGTG
AACCGAGATAGTTCCACTGCACTCCAGCCTGGGCGACAGAACGGTTTTTGTATGCTTCAACCTTA
CTGAACTCATTTATTCATTCTGATATTTACTTTAGTGGATTCTGTATGATTTTCTATATGCAAGA
TGCTGTCATTTGCAAATAGAGATAGTTTTTCTTTTTTTGTTTCCAATCTGAATGTGTTTTATTTC
ATTTTCTTGCCTAATGCTCCTCATTAGTTTTCAATGTTGCATAGTATTTTATTGCATGGACGCAC
CATAATTACTTTTACCAATCTCTTATTGATGGACATGAAGGTTATTTCCAAACTCTTGTGGTTAT
AACAATGCTGTAATAGATAACCTATTACAAAGAACAGTTCTCAACTCTTTTGGTCTTGGGACTAC
TTTACCTATTTATGTATAAGTTTCAAGTTTGGGCTTAGAAAGAATTTAATAATCATGCTAATTTT
GTTTTGTTTTCTTTTTTTTTACTCCTGGACCCAAGCGGTCTTCCCACCTCAACCTCCCAAGTAGC
TGAGACTACAAGGGTGAACCATCACCCTGGGTAATTTTTAAATTGTTGGCTGGGCACAGTGGCTC
ACGCCTGTAATCCTAGCACTTTGGGAGGCTGAGACAGGCGGATTACCTGAGGTTGGGAGTTCAAG
ACCAGCCTGGCCAACATGGTGAAACCCTGTCTCTACTAAAAACACAAAAAATGAGCCAGGTGCAG
TGGTGCGTGCCTGTAATCCCAGCTACTCAGGAGGCTGAGGCAGGAGAATTGCTTGAATTCAGGAG
GTGGATGTTGCGGTGAGCTGAGATCGTGCCACTGAACTCCAGCCTGGGCGACAGAGCAAGATTTC
ATTTCAAAAAACAAAAAGAAAAAAATTTTTAAAAATTGTTTTGAAGAGATACGGTTTCCCTATGT
TGCCTAGGCTGGTCTCATGCGATTCTCCTGCCTTGGCCTCCCAAAGTGTTGGGATTATAGACATG
AGACACCACAAATTTAAACAAGGACTTTTTTTATTTTTTAAAGAGATTACTTTTTCTGAGTAAAC
AAGGACTTTTAAAACAAGGTACTAAAAATCTGGCTGGGCGTGGTGGCTCGCTCCTGTAATCCCAG
CACTTTGGGAGGCTGAGGTGGGCGGATCACGAGGTCAAGAGATCAAGACCATTCTGGCCAACATA
GTGAAACCCCGTCTCTGCTAAAAATACAAAAATTAGCTAGGTGTGGTGGTGCACGCCTGTAGTCC
CAGCTGCTCAGGAGGCTAAGGCAGGAGAATCACTTGAACCCGGGAGGCAGAGGTTGTAGTGAGCC
GAGATCTCACCACTGCACTCCAGCCTGGCAACAGAGTGAGATTCCGTCTCAAAAAAAAAATTTTT
TTTAATAAATAAATAAATAAAAATCTTGAAATTTTTATTAGGTCCTGGTGTTTCTAATTTTAATA
TGATTTAGTTCTCAAGTGCTAGTTAATACTTCATTAATCAGCCAGATGGAAGTGGGGATACTATG
GAAACAGCATAGGCAAAGCTTAAAGATAAATGAGACCATGGTTTGAAAATATAGGGTGGCATGCG
CTTTGGTTCAAGGCAATTTGATCATCACAACAATTTGGCTTAAACAGCACTTTGGTTGAAAATGA
ATATCCCCTAGTTATGTGTTTTTCAAGTATTGGTCATTTTGGTATATCATGAGTTGTTTTGCAAA
CTTTTGTGCCAAAGTTTTCAGGAAAACTTTCTAATATTTGCTTTTGTGTTTCTAACTGATTTTCA
GAGAAGTTGTAATTTTGATGTTTTTTCCTTTTAGTGAGCATGCTTTAACAAAAAACAATAACAGA
AACTGTGTCAAAGAAAAGGACCTGTAATCTTCAGGGTTTGTAGTCTTTTTCCTCTTAAAAAACCC
TTTTCCTAATTAATGGCAGTTACATCTGCATGGCTGGTTTGGGTAAGTCTTCATTTTGTTGTATT
GCTGAGTAACAGTCAACAAAGGTTTATCAACTCTTGGTTAAGGGTTCCTTTCATGTTGTGAGTAA
ACATGAACAATATAGGATCTTATCCTTTTAAGCTATCATGCAAGAAACATGTGAGGTCTCTTAAA
AATTCACTGTGCTGGCCGGGCATGGTGGCTCACGCTTGTAATCCTAGCACTTTGGGAGGCTGAGG
TGGGTGGATCACTTGAGGTCAGGAGTTCAAGACCAGCCTGGCCAACATGGTGAAACCCCGTCTCT
ACAAAAATACAAAAATCAGCCGGGCATGATGGCGGGCAGGTGCTTGTAATCCCAGCTACTTGGGA
GGCTGAGACAGGAGACTCGCTTGAACCCGGGAGGCGGAGGTTGTAGTGAGCCGAGATTGTGCCAC
TGCACTCCAGCCTGGATGACAGAGCAAGACTCCATCTCAAAAAAGAAAAAAAAAAAAAATTGTGC
TGGCTGGGCTCAGTGGCTCACACCTGTAATCCCAGCACTTTGGGAGGCCGAGGCGGGTGGATCAC
CTGAGGTCAGGAGTTCAAGACCAGCCTGGCCAACATGGTGAAACCCCATCTCTACAAAAATACAA
AAATTAGCCAGGCATAATGGCGAGTGCCTGTAATCCAAGCTACTTGGGAGGCTGAGGCAGGAGAA
TCGCTTGAACCCGGGAGTGAGCCGAGATGGCGCCACTGCACTCTAGCTTGGGTGACAACAGCAAG
ATTCTGTCTCAGAAAAAAAAAAAAAATTAACTGTGCTTATAAATGGGAGCTAAATTAGGAAAAAA
ATAAAAAGTAAAAAGAAAATGAAAATAAAAATTTAAAAAATATATTAACAAATTACCTGTCCTAA
GGTAAAATTCTTTTTTTTTTTCTTGAGACGGAGTCTCGCTCTGTCGCCCACTCGGAAAGGAGTGC
CAATCTCGGCGTGAAAATGTGTCTGATGCGTATGCACCTGAGCTAGAAAGCCCAAAGACTGCTAA
GAAGCATGTGAGGGCTCAGAAACAAACATGTTTGGGCTTCGAAAGCCTGTTTTTGGAACCACTTT
CCCTTGTCTGCAAGGCAGAGGGAGGGAGGTACTCTGTTATTTCTAAGTCTCTCTTGAGCTCTTAC
ACTGTGCAAGCCCATGAACGTATTTAATCGTGCATTAGACAATTGTTTTTAATCTATGCCCTGCC
TCTCCCAAGATCAACCTTTCCCTGAGATCGGGGCCCCCTCTGGGTGCACAGGGATATTTTTATTT
TTTGAGTTGGAGTTTTGCTCTTGTCACCCAGGCTGGAGTGCAATGGCATGATCTTGACTCACTGA
AACCTCTTCCTCCCGGCTTCCAGTGATTCTTCTGCCTCAGCCTCCCAAGCAGCTGAGATTACAGG
CATGCACCACCACACTTCGGTTAATTTTTGTATTTTTAGGAGAGATGGAGATTCACCATGTTGGC
CAGGCTGGTCTTGAACTCCTGACCTCAGGTGATCCTCCCGCCTTGGCCTCCCAAAATGCTGGGAT
TATAGGCGTGAGGCACCGTGCCCAGCCCATAGGGATATTTTTATATACTTTCCTGCCCCATGGGT
CAACTGTTCTTGAACCAAAGAAACAAGAGGCGGGGAAGTTATAGGAAGCTTTTAAAATATGCTTC
TGTGCAGCACTGCTCGCAGCGTGTCACAGATGTGCGGTATTGGAAGACGAAGGTGAAACTGCATG
GAGATGATTGTGTGGGGGATGAGGAGGTGGTGGGTAGGGGACTTGGCTTTCTTCACACAAAGACA
TCCAGGCAAATGGTAAGTCCAAAAGCCCTGTGACAGATAATGGCCATTGTTCCTGCAGGGTGACT
CTTTTCTCTTCTTTTTTTTCTTTTTGAGGCGGAGTCTCACTCTGTCATCTATGCTGGAGTGCAAT
GGTGCGATCTTGGCTCACTGCAACTTCCGCTTCCCGGGTTCAAAGTGATTTTTCTGCCTCAGCCC
TCCCGAGTAGCTGGGACTACAGGTGCGCGCCACCATGGCCAGCTAATTTTTATATTTTTAGTAGA
GACGGGGTTTCTCCATGTTAGCCAGGATGGTCTCGATCTCTTGATCTCGTGATCCACCCGCCTCA
GCCTCCCAAAGTGCTGGGATTACAGGCGTGAGCCACCGGCGCCCGGCCCTATACACATGATTTTG
AACATACTGACAGATGGAGAAAACCACTTTGGAAAAGATACTTCACATGTTCTAGAGACGATTTA
AACCATTAAGCATTCTATGAAGCTTCTGAAGGTCTGTCAGATTTTAAATGACAACAGTGAAATTT
TAAAACAAGAACAGAAGTCAGCACCAAAGCTAGTTTAACATTAATAATAAGTGAGCCAATAAATA
GGTCTATGTTTGCCCAGGCAGGTTTTGCTTATTATGTCAGTTGGAAAGCCAGAAGGAAACTGGTT
TTAACTCTTAATATAACCTGTATCATGACACCATCACTTTACCAGAAATGTAGCTGATGTCAGCA
TAAGACTGAGACAGTTTACATTTAAAACTGTTGTTTCCTTTCCAACTATTTTCATAATTCATTCA
TGGTATAGGATTGAGACTATTTCCTTAAACAGAAAAAAATGGGTAATTAACATTGAGAACTTTCC
ATGTGCCAGATACTGTATGAACTGTCTTAATTTTCATAGCCACCCTGCAAGATATTATCCTCATC
TTTTTAGAGGAAGAAACAAGTTTCAAGAAATGAAGTAGGTTTTCTAAGGCCACAGCTATAGTAAA
GAGGTGGAGCTGACATTCAAGCTTGGATATGAATTATTATAATTTCCACAGCACTACACAGCTGT
CATTTTCTCTACCTGCAAAACTAAATAAATACTGTTAAAAATAAAAGATGATCTCCAAGATCTCT
AAACATTAAAATTTTACAATAAACTGGTTGAGGTGACACATGCCTATATTTTCAGCTACTCAGGA
GTTTGAGACTGGCCTGGACAACATAGCAAGACCCTGTCTCTAAATTTAAAAAACAAATTACAATG
AGATAATCTTAGACCAGAGAAAGGAAAGTGAAATAGCTATTTGGATTATAAACTGTTTTAGTAAC
TCAAATGTAATGTGTGGTGGTGACAATATCTTTGATTCCTGGGAAGGTCATTGTGAAAGGGAATA
GAAAATGCCTTGAAGTCAAAATATAAGGCTCTCAAATAGAAAAATAAATATAACATTTAAGTATT
ATCAACAGAGAACCAAGTTAGAAAAAACTAGTTATAGTCTGAAACAATGCTGTTTAAAAGACTGC
AGTCACCAGTGTAAACTGACTCAGGCAACACTTCCCAGGGTCCATGCCGTGGACAACTGACTAAT
CTCTCTATAAACAATTCTTGACACTAGATAGGCCTTTACTAAGAGCAACCAGAGACAGAAATTAG
TATCGACAGTGGAGTTTTAAAATCACACTTAAAAAAATATTATTGGCTGGGCACAGTGGCTCACG
CCTGTAATCCCAGCACTTTGGGAGGCTGAGGCAGGCAGATCATGAGGTCAGGAGATCAAGGCTAT
CCTGGCCAACATGGTGAAACCCCGTCTCTATTAAAAATACAAAAATTAGCCGGGCGTGGCGGTGA
GTGCCTGTAGCCCCAGCTACTTGGGAGGGTGAGGCAGGAGAATTGCTTGAACCTGGGAGGCGGAG
GCTACAGTAAGCCGAGTTCGTGCCACTGCACTCCAGCCTCGGCGACGGAGCGAGACTCCCTCTCA
AAAAAAGAAAAAAAAAATGTAGATTATATTCTGTGAATATTACATCACAGAATAAAACTCTGGAT
ATAATACATGGGAGAGTTAATATCCAGAAAGACATTGTGCATTTTTGGTCTAAGTTTCATGAGAC
AAAATATTATTTTCTTTTCTGAGACTCAATTCTTTCCCAAAGGGATCAGTTCTCTTAAGTGGACC
TTTTTACAGCCTTTCAGCTGGCTCAAAAGATGAGTTTTGGCGAACAAGATTATCGATACTCACTG
AGCAAGTGGTAGTTAGAATCCCTTTCATATTTGAAGGTCAAACGGCCATAGCTGACATGATTTAG
ATTCTTCAGCCACTCAAAGTAAGATACTGTCACTCCTCCAGCATTCAAGTAGAGATCCTATGCAC
AAAAATAAGACAAAGAAATTAGAAGATGATGGTTTTCGTAAAAGCTGAAAATGAACCTAAGACCT
TAATTTCAATACCAAGGTAGACTGGACTTCAAATATCGCAAATATATTTTAGCCAGTATCAGGAA
TTTCACACTTAATTAACACTCCTTCCCATCCCACCCAATTCCATCTAAGGCTTTTTCTATTTAGG
AAAAAAAAAAATCATTTTTTGGCTTATTAATCAAGGAAAGTTAATAATCTTTGGTTAGAGCCTCT
TCTCTACCAGAAGTTAGTTCTCAGACTAAATGGCTTGCCCACCAACCAGTTGGACTGGACTGTCC
ACAGGGCCTCTCAGAAGACAGGATTCTTTCTCCTATTACCTAAGGGTAGCCCATTTCAGTTACAT
TAAATGTCTTAAGTGCTTTCAGCAAAGGGGGTTCTTTAAAATATATTCCAAGCCCACATTAATTT
CTAGTAACTTTTTGGTGTAGACTCATTTTTACTTGCTAAAAAACCTGAGCACGTGTTCCTCATAT
TAGTTTTCTGAGTAAAGCTGGAAAGGGCACTTGAAATGCATAAGGTTAGGAATCATATAGAAAAT
CTTAAGAGCTTTAGTTAGAATAGTGTTTCTAACACAGTACACATTTATATAACCAGACTCTTAGA
AGGCTAAAGACATTCAGTAAAGAGCCTGAAATTGGAATAAATGTTTCGATCAAAGTGAAAATTAA
CAGGCTTAGAATTAACCATGCTTCTACTATATTTTCTCAAAAGTGAAAAAGATGAATTCACTAGA
GCTTGGAGACTAATAATTCCTCTCTTCCTCCAAATTCCTTGCAAAAGACTATTATGATTCTAAGT
ACATATAAAGCCTAATAAATATAGATGACTTACTGGAATAACCATAATGTTTCTCTCCAGGAAGA
TCTTGTCAGCTTCTGGAGTTGTTGGCCCATTGGCACCTTCAGCAATGATCTGCAAGAGAGTCAGG
AACATAGAGAAATGCGAACACCACCGTCAAATCCCCTCCACTGAGGGCAAGAGATGTGCATATAT
GAACAAGGGGCTGTGGGGAGAAGCACAGTTTCAGTTAAAGTTAAATAGAGGTTATTTTTCTCTGC
CAAGTGTATAAAACTACCTTTCACTTTTCTATTTATCTAGGTTTTTTTTTTGTTTGCTTGTTTTT
TTTTTTTACAGGAGTGTCAGGCAGATGCGTTTGTTTTGGTAATGGTTGCACAACTCTGTGCCGGT
AGCTAAAAGCCATTAAATTATGTACCTTAAATGGGGGAACTGTATGGTATGTGCAGTATGTGCCA
ATAAAGCTGCTAAAAAGAAAGAGAAAACTCAATCAGACTCTTCTATGACCCCCCTAACGTCATTC
ACATTGATAATGTTGGTTCTGGTTTCTATAATGTTGTCACCTTGGCTTTGACTCTGGGTGCGTTG
GATTTGGTCAACTGCTTCTCACTGGCAGCTGGGATCAGTATGTCACAGTCGGCCTCCAAGATGCT
TCCTTCATAGGGCTTTGCCTTGGGGAAGCCCAGAATGGACCCATGTTGCTGCCATTGATTGAAAA
TCACAATTAATAGCTGCACCAGAGTTTTAAATATTTATATTTAGTGTCTATGCTATAAAAATGTA
TTAATACCAATTTGAAGTCTTCCAGTTCCTTTGGGTCAATACCATCTGGATTCCATATACTCCCA
TCAGACTCACCAACAGCAATACATTTAGCACCAAAACGATGTAAATATCTCATAGAGTGCAGGCC
CACATTACCAAATCCCTGTGAAGAACAATTACCCATAACACAAAAATTAAAGTCCTGGTATAGAC
AGCAAGAGTCATATTTTGACCAATGTAAATCCATACTCTGTTTATTTAGAAGCAATTCTCAAAAT
TCTTTTGCCAAAAGAAACAATGTACTAACTGGTTTCTCTTCAACAATAAAATTCTCTGTTTAAGA
ATGTGATGAGCGGGCATGGTGGCTCACGCTTGTAATTCCAGCACTTTGGGAGGCTGAGGCAGGTG
GATCACTTGAGGTCAGGAGTTCGAGATCAGCCATGGCCAACATGGTGAAACCCCGTCTCTACTAA
AAATACAAAAATTAGGCATGGGGTCCGTGCCTGTAATCCCAGCTACTTGGGAGAATGAGGTAGGA
GAATCACTTGAACCTGGGAGGTGGAGGTTGCAGTGAGCCGAGACTGCACTCCAGCCTGGGCAATA
GGGTGAGACTCCATCTCAATCAATCAATAAATGGCAGTGGTGTTAAGTACACCACCACTTTTTGC
TTTTTTTTTTTTTTTTTTTTTGATGGAGTTTTGCTCTTGTTGCCCAGGCTGGAGTGCAATAGCGG
AATCTCGGCTCACCACAATCTCTGCCTCCCAGGTTCAAGCAATTCTCCTGCCTCAGCCTCCTAAG
TAGCTGGGATTACAGGCATGCGCCACCTCGCCTGGCTAATTTTGTATTTTTAGTAGAGACAGGGT
TTCTCCATGTTGGTCAGGCTGGTCTCGAACTCCTGACCTCAGGTGATCCGCCACTTCAGTCTGCT
AAAGTGCTGGGATTACAGCTGTGAGCCACAGTGCCCGGACTTTCTTTTTTTTTTTTTTTTGCCAA
TTTGTATTTTATTTTTGCTAATTTAAAAAATAGTTAATAGAATATCAGAAATACTGAACATTATC
ATTTCCATAAATGCAAGAGTGTATACATTTTCCACACACTGAGTACTAGCTAGATTTTCTATGAT
AAACTCTGACCACTTCTTCAGGCAATTCATGTACTTACTTCAGCATTATCATTAATGATGAAGGT
TCTAGAACCATCATGAACAAGGGTCCCATCTTCACACAAGTTACTTAACTGCTGGGAGGCTCTAT
TTCATCTTATGTAAACTACAGATAATACCTACTCACCTCAAGGGTATATCAAGAGTTTATGTAAG
CTAAGTTTGTAGAAAGTAGTTAGCACAGTGCCAGGAAGGGTCCAAGAAGAAATGGTACTTACTAT
GAAATATTTGTACGTATATATGTATGCATGTTAATGAGCTCTTATTAGCTGTGTTCATTAAAGGT
TTTCTCTATCCTGTGATTTGCTTTTAGATTTTGGAATACATTTCATTGTGCACATTCCATTTGTA
TTATTAATATAACAATATTTATTACTATTATTATTATCATCATCAATTCAATCACATCTACTGTA
TCCCTGATGATGACCATGATTCCTTTAATAATCATAAAACTCTCTTCCCTTCATCACGGGGTAAA
TAACCTATCACAATGCTGTAAGTCTCCATCAGCACCCCAGGCTGCCCCTGCTGACTTACCAGATC
TGCTACTTCAGCCAGATCAATCATCATGTTAATGTCACACCCACATTCAATAATGGTGAGTCGGA
GCTTTTTACCTGTAAGTGAAAAAGATAAAAATTTTACTTTAAAAAGACCCTGAAA

运行：

# time ./1 datafile > report

real    1m14.81s
user    0m50.65s
sys     0m0.13s

# wc -l report

3355 report

下面是 report 文件中的部分内容:

# cat report

------------------- Line# 1 --------------------

TAATCAACTA Length=10 Position=10 Rev_Position=12
TTTATTACTA Length=10 Position=51;9703
GGAGGCTGAG Length=10 Position=330;470;1129;1265;1633;2655;2793;3102;5936;8564
AAAAAAAAAA Length=10 Position=1871;2906;2907;2908;2909;2910;3198;3199;3200;3201;3202;6183;6761;6762 Rev_Position=2906;2907;2908;2909;2910;3198;3199;3200;3201;3202;6183;6761;6762
GTAGTGAGCCGA Length=12 Position=1811;2838
AATAAATAAATA Length=12 Position=1889;1893 Rev_Position=1890;1894
CCACTGCACTCCA Length=13 Position=534;1830;2857;6133
GTTTTTCTTTTTT Length=13 Position=675 Rev_Position=4304
GTAATCCCAGCTAC Length=14 Position=1248;2776;8678
CCTGTAATCCTAGCA Length=15 Position=310;1109
GGATCACTTGAGGTCA Length=16 Position=2671;8580
CGGGCATGGTGGCTCAC Length=17 Position=2617;8526
CACTTGAGGTCAGGAGTT Length=18 Position=2675;8584
CCAGCCTGGCCAACATGGT Length=19 Position=1172;2698;3011
CTTTGGGAGGCTGAGGCAGG Length=20 Position=5931;8559
TTTTTTTTTTTTTTTTTTTT Length=20 Position=8841;8842 Rev_Position=8842

Summary of Line# 1
------------------
String length :: 10 Matched Strings :: 541
String length :: 11 Matched Strings :: 438
String length :: 12 Matched Strings :: 372
String length :: 13 Matched Strings :: 329
String length :: 14 Matched Strings :: 293
String length :: 15 Matched Strings :: 258
String length :: 16 Matched Strings :: 226
String length :: 17 Matched Strings :: 200
String length :: 18 Matched Strings :: 171
String length :: 19 Matched Strings :: 146
String length :: 20 Matched Strings :: 124

String length :: 10 Matched Reverse Strings :: 142
String length :: 11 Matched Reverse Strings :: 69
String length :: 12 Matched Reverse Strings :: 40
String length :: 13 Matched Reverse Strings :: 25
String length :: 14 Matched Reverse Strings :: 15
String length :: 15 Matched Reverse Strings :: 7
String length :: 16 Matched Reverse Strings :: 5
String length :: 17 Matched Reverse Strings :: 2
String length :: 18 Matched Reverse Strings :: 1
String length :: 19 Matched Reverse Strings :: 1
String length :: 20 Matched Reverse Strings :: 1

lightspeed 回复于：2004-12-16 23:39:29

这里是 final version.

1. 增加了二分查找最长匹配串并自动设置 STR_MAX 的代码。
2. 改进了 reverse string 算法，大大提高了运行效率。

# time ./1 datafile > report1

real    2m57.43s
user    2m29.33s
sys     0m0.08s

$ time ./1 -v r=1 datafile > report2

real    0m53.28s
user    0m46.03s
sys     0m0.03s

#!/bin/awk -f
#
# A script can be used to check any repeat pieces of nucleotide sequences.
#
# Design: lighspeed
# Date: Dec. 16, 2004
#
# Repeat Match Usage:: $0 datafile
# Reverted Repeat Match Usage:: $0 -v r=1 datafile
#

# function is_overlap : check if a string (position=p, length=l) is overlap with
# matched strings which are stored in array record (position=i, length=record)

function is_overlap(p, l) {
e = p + l - 1
for (i in record) {
   a = i + record - 1
   if (( i >= p && i <= e ) || ( a >= p && a <= e ) || ( p >= i && p <= a ) || ( e >= i && e <= a ))
      return 1
}
return 0
}

# flag=0 find the longest matched string and set STR_MAX
# flag=1 find all other matched strings

function find_string(STR_MIN, STR_MAX, flag) {

for (i in record)
delete record

if ( flag == 1 ) {
    if ( r == 1 )
      print "---------------Reverted Repeat Match Line# "NR" -----------------\n"
    else
      print "------------------Repeat Match Line# "NR" --------------------\n"
}

for ( Str_Len=STR_MAX; Str_Len >= STR_MIN; Str_Len -- ) {

    for ( Position=1; Position <= L - 2 * Str_Len + 1; Position ++ ) {
      if ( is_overlap(Position,Str_Len) == 1 )
        continue

      count=0
      pos=Position
      offset=Position + Str_Len - 1
      left=substr($0,Position,Str_Len)

if (index(left,"A")==0 || index(left,"C")==0 || index(left,"G")==0 || index(left,"T")==0 )
continue

right=substr($0, Position + Str_Len)

# Reverse string left. The start position in reverse string is L -Position - Str_Len + 2

      if ( r == 1 ) {
        old_left=left
        left=substr(REVERSE_STRING, L - Position - Str_Len + 2, Str_Len)
      }
      while ( Str_Len <= length(right) ) {
        i=index(right,left)
        if ( i > 0 ) {
          if ( flag == 0 )
            return 1
          j=offset + i
          if ( is_overlap(j,Str_Len) == 0 ) {
     count ++
            record[Position]=Str_Len
            record[j]=Str_Len
     pos=pos","j
          }
          right=substr(right, i + Str_Len)
          offset+=(i + Str_Len - 1)
        }
        else
          break
      }

      if (count > 0 && flag == 1) {
        match_number[Str_Len] ++
        if (r == 1)
          print "Reverted Repeat: " old_left",", "Size: "Str_Len",", "Start Positions: "pos
        else
          print "Repeat: " left",", "Size: "Str_Len",", "Start Positions: "pos
      }

    }
}
if ( flag == 0 )
    return 0
}

{

L=length($0)
if ( r == 1 ) {
    REVERSE_STRING=""
# split($0, aaa, "") : Use null string "" to split every characters into array aaa
    split($0, aaa, "")
    for (i=L; i >= 1; i -- ) {
      REVERSE_STRING=REVERSE_STRING""aaa
      delete aaa
    }
}

STR_MIN=10
STR_MAX=0

# Find max matched string and set STR_MAX by binary search algorithm
low=STR_MIN - 1
high=int(L / 2) + 2
while ( low < high ) {
    if ( (high - low) == 1 ) {
      if ( low >= STR_MIN )
        STR_MAX=low
      break
    }
    mid=int((high + low) / 2)
    status=find_string(mid, mid, 0)
    if (status)
      low=mid
    else
      high=mid
}
if ( STR_MAX >= STR_MIN )
    find_string(STR_MIN, STR_MAX, 1)
}

3. data2 (100000 字符) 的结果

当长度增加到 100000 时，速度变的很慢，我只测了正序，而且没有完全
完成，但可以估计时间。

由于存在的重复匹配串的最大长度很小，我采用二分查找首先找到重复匹配串的最大长度
然后再循环至最小长度。下面结果前面的

9 50002 0
9 25005 0
.

就是显示查找的过程。找到重复匹配串的最大长度为 43 用时 67 min.
然后，从 43 循环至 10. 每个长度用时约 5 min

总时间大约为 67 + 34 * 5 = 237 min 也就是大约 4 小时。

9 50002 0
9 25005 0
9 12507 0
9 6258 0
9 3133 0
9 1571 0
9 790 0
9 399 0
9 204 0
9 106 0
9 57 1
33 57 0
33 45 1
39 45 1
42 45 1
43 45 0

Repeat: ATTGGATCATTGATCTAATCCAACCACATAACTATAATTACAG, Size: 43, Start Positions: 25161,25204
Repeat: TCGGCCTCCCAAAGTGCTGGGATTACAGGCGTGAGCCACCG, Size: 41, Start Positions: 26357,75092
Repeat: AGTCTTGCTCTGTCGCCCAGGCTGGAGTGCAGTGGCGCG, Size: 39, Start Positions: 31148,69805
.
.

产生随机字符串
$ cat rand.pl
#!/usr/bin/perl -w
@array=("A","T","C","G");
for ($a=0;$a<1000;$a++) {
$rand=$array[int rand scalar @array];
$out.=$rand;
}
print "$out\n";

$ perl rand.pl>datafile
$ cat datafile
ATACTCGTTGACTCTACTCATAACAGCATTAAAGACCGTAGGGTAGGCT...
riverfor 回复于：2004-12-18 03:18:35

=======================repeat.py===========================
# !/usr/bin/pyton
# Just enjoy the programming, share your excellent code
# report bugs to email/ msn: [email protected]
#
import string
import commands
import sys
## data for deamon
data = "1234567890112345678901234567890 1234567890989901234567890"
## call this functions to get the real data which was saved inthe filePath
def getSrcDataFromFile(filePath):
    data = commands.getoutput("cat %s" % filePath)
##
result = []
## get all substrs used to check whether be fit for
def getAllSubStr(splitCode = " ", minDataLen = 10, maxDataLen = 10000):
    dataLen = len(data) + 1
    for x in range(dataLen):
        for j in range(x, dataLen):
            seg, ilen = data[x:j], j - x
            # check whether to be fit for these conditions
            if seg.count(splitCode) == 0 :
                if ilen >= minDataLen and ilen <= maxDataLen:
                    if result.count(seg) < 1:
                        result.append(seg)
                   ## process
def process(filePath = ""):
    if filePath != "":
        getSrcDataFromFile(filePath)
    getAllSubStr()
    print "sub data\t repeat \t indexs"
    for item in result:
        counts, itemlen = data.count(item), len(item)
        if counts > 1:
            indexs, start, seg = [], 0, data
            for x in range(counts):
                if seg != "":
                    start += seg.index(item)
                indexs.append(start)
                start += itemlen
                seg = seg[start:]
            print item, "\t" ,counts, "\t" ,indexs

if __name__ == "__main__":
    print "source data: %s " % data
    print "========result:========"
    if len(sys.argv) < 2:
        process()
    else:
        proccess(sys.argv[1])

================================================
This script only print the sub data repeats twice or more, which was with the condition of splitCode = " ", minDataLen = 10, maxDataLen = 10000.
Usage: python repeay.py [data file] [| awk / sed ....]

第一次发贴,嘻嘻,没时间写注释啦,但python本来就是如此易读(不要笑话我程序中的英文注解的语法错误哦,因为很多系统的中文支持不好,习惯了).很纳闷为什么cu连php版面都有,却连python的论坛都没有呢,我用过php, java, c, python. 我觉得python绝对是值得我们关注的一门语言,它可以用做shell(远比sed awk易读), 网站脚本(mod_py), application语言(网络的twisted框架, tk的GUI, 各种数据库的支持)......

用awk写了一下第一题，
用了最笨得办法，效率超低。处理这个datafile用了10s，而且只适用处理短一些的串。。。

BEGIN {
        _MIN_LEN=10;
}
function find_max_str()
{
        for(i=length($0)/2;i>=_MIN_LEN;i--) {
                for(j=0;j                         k=substr($0,j,i);

                        if((index(k," ")>0)||!((index(k,"A")>0 && index(k,"C")>0 && index(k,"G")>0 && index(k,"T")>0))) {
                                continue;
                        }

                        if((a[k]++)==2) {
                                printf("%d:%d:%d:%d:%s\n",NR,b[k],j,length(k),k);
                                return 0;
                        }
                        else {
                                b[k]=j;
                        }
                }
                for(idx1 in a) {
                        delete a[idx1];
                }
                for(idx2 in b) {
                        delete b[idx2];
                }
        }
        return 1;
}
{
        find_max_str();
}

zhl1979 回复于：2007-03-27 19:16:25

awk '{ for (l=10;l<50;l++){for(i=1;i<(10001-l);i++){a=substr($0,i,l) ;hash[a]++ ; t=hashb[a]; t=i" "t; hashb[a]=t }}}END{for(a in hash ){ if (hash[a]>1){ print a ,hash[a], hashb[a] }}}

你可能感兴趣的:(找最大重复字串)

webpack性能优化策略雅望天堂i webpack 前端 node.js
1.代码分割（CodeSplitting）通过代码分割，可以将代码拆分成多个较小的文件，实现按需加载，减少首屏加载时间。使用SplitChunksPlugin将公共代码提取到单独的chunk中，避免重复打包。config.optimization.splitChunks({chunks:'all',cacheGroups:{//第三方组件libs:{name:'chunk-libs',test:/
23种设计模式-享元(Flyweight)设计模式萨达大软考中级-软件设计师设计模式享元模式软考软件设计师 C++行为型设计模式 JAVA
文章目录一.什么是享元设计模式？二.享元模式的特点三.享元模式的结构四.享元模式的优缺点五.享元模式的C++实现六.享元模式的JAVA实现七.代码解析八.总结类图：享元设计模式类图一.什么是享元设计模式？享元（Flyweight）设计模式是一种结构型设计模式，通过共享对象来减少内存占用和对象创建开销。它通过将对象的可共享部分与不可共享部分分离，减少重复对象的数量，从而节省内存。享元模式的核心思
solidjs中实现vue中的keep-alive功能的总结 chrome-devtools
在Solid.js中，虽然没有像Vue中keep-alive这样的直接API，但你可以使用类似的方式来保持组件的状态或避免组件的重复挂载。Solid.js中的组件本质上是基于反应式系统的，每个组件都在被销毁时自动清除其反应式状态。所以，如果你想模拟keep-alive的效果，可以使用以下几种方式：1.使用createEffect或createMemo保存状态你可以通过使用createEffect或
solidjs中实现vue中的keep-alive功能的方法 angular
在Solid.js中，虽然没有像Vue中keep-alive这样的直接API，但你可以使用类似的方式来保持组件的状态或避免组件的重复挂载。Solid.js中的组件本质上是基于反应式系统的，每个组件都在被销毁时自动清除其反应式状态。所以，如果你想模拟keep-alive的效果，可以使用以下几种方式：1.使用createEffect或createMemo保存状态你可以通过使用createEffect或
SMBJ20A 二极管的作用揭秘 GR6692 二极管数据库管理员 eclipse python
30KPA84A单向TVS瞬态抑制二极管二极管产品已经跟我们的生活有着密不可分的联系了，TVS瞬态抑制二极管，是一种高效能保护二极管，产品体积小、功率大、响应快等诸多优点，产品应用广泛。TVS瞬态抑制二极管30KPA84A，是一种二极管形式的高效能被动保护器件贴片TVS瞬态抑制二极管详情简介TVS瞬态抑制二极管30KPA84A极性(单双向)：单向VRWM(V)电压84V最大箝位电压@IPP：139
实战优化登录系统：实现是否支持多设备、最大设备数等可配置化 wujiada001 #实战优化 java
使用场景：有些用户可能需要在多台设备中登录同一个账户，同时希望设置可以登录的设备数。举个例子：公司的账户只允许五个员工登录系统。实现方案：利用redis的Zset有序集合，使用登录的当前时间戳作为分数，后续达到最大设备数之后，删除分数最小的，也就是登录时间最早的设备，实现强制退出。登录时需要保存token配置信息读取yaml文件#用户登陆配置user-login:#token到期时间单位秒toke
Redis主从复制配置土尔奇酱 mysql redis 缓存数据库
1.主从复制原理 Redis一般是使用一个Master节点来进行写操作，而若干个Slave节点进行读操作，Master和Slave分别代表了一个个不同的RedisServer实例。另外定期的数据备份操作也是单独选择一个Slave去完成，这样可以最大程度发挥Redis的性能，为的是保证数据的弱一致性和最终一致性。另外，Master和Slave的数据不是一定要即时同步的，但是在一段时间后Master
网页中加载 SVG 的七大方式前端熊猫 Svg javascript html svg vue
一、直接使用标签加载外部SVG文件优点：简单易用：与加载其他图片格式（如PNG、JPEG）相同。浏览器支持良好：现代浏览器普遍支持。可缓存：SVG文件可以被浏览器缓存，减少重复请求。缺点：无法直接操作SVG内部元素：如果需要对SVG内部的元素进行交互或样式修改，这种方法不适用。适用场景：静态图像展示：仅需要展示SVG图像，不需要与之交互。二、将SVG作为CSS背景图片.icon{width:100
C语言——算找零 yiqi_perss C语言 c语言 c++算法
#includeintmain(){intprice=0;printf("请输入金额（元）：");scanf("%d",&price);intchange=100-price;printf("找您%d元。\n",change);return0;}需要：1、有地方放输入的数字;2、有办法输入数字;3、输入的数字能参与计算。1.7读整数使用一个新的函数：scanf(“”);scanf("%d",&zh
蓝桥杯 Java B 组之设计 LRU 缓存计算机小白一个 java 蓝桥杯算法
Day7：综合练习-设计LRU缓存一、什么是LRU（LeastRecentlyUsed）缓存？LRU（LeastRecentlyUsed）缓存是一种基于最近最少使用策略的缓存机制，用于管理固定大小的缓存，当缓存满时，会淘汰最久未被使用的元素。LRU设计核心缓存的最大容量capacity支持get(key)操作（O(1)时间复杂度）支持put(key,value)操作（O(1)时间复杂度）当缓存满时
Python 基础-循环赔罪 Python 系统学习 python windows 服务器
目录简介breakcontinue小结简介要计算1+2+3，我们可以直接写表达式：>>>1+2+36要计算1+2+3+...+10，勉强也能写出来。但是，要计算1+2+3+...+10000，直接写表达式就不可能了。为了让计算机能计算成千上万次的重复运算，我们就需要循环语句。Python的循环有两种，一种是for...in循环，依次把list或tuple中的每个元素迭代出来，看例子：names=[
刷题计划day29 动规01背包（一）【01背包】【分割等和子集】【最后一块石头的重量 II】哈哈哈的懒羊羊算法 java 数据结构 leetcode 动态规划背包问题蓝桥杯
⚡刷题计划day29动规01背包（一）开始，可以点个免费的赞哦~往期可看专栏，关注不迷路，您的支持是我的最大动力~目录背包问题前言01背包二维数组dp[i][j]关于是否放物品：关于二维dp遍历顺序：一维数组dp（滚动数组）关于一维dp遍历顺序：题目一：416.分割等和子集题目二：1049.最后一块石头的重量II背包问题前言对于面试的话，其实掌握01背包和完全背包，就够用了，最多可以再来一个多重背
刷题计划day28 动规（二）【不同路径】【不同路径 II】【整数拆分】【不同的二叉搜索树】哈哈哈的懒羊羊数据结构算法 java leetcode 蓝桥杯面试动态规划
⚡刷题计划day28动规（二）继续，下一期是背包专题，可以点个免费的赞哦~往期可看专栏，关注不迷路，您的支持是我的最大动力~目录题目一：62.不同路径法一：动态规划法二：动态规划空间优化题目二：63.不同路径II题目三：343.整数拆分法一：动态规划法二：数学法（复杂度最低）题目四：96.不同的二叉搜索树题目一：62.不同路径62.不同路径(https://leetcode.cn/problems
刷题day27 动态规划（一）【斐波那契数】【爬楼梯】【使用最小花费爬楼梯】哈哈哈的懒羊羊动态规划算法数据结构蓝桥杯 java 面试背包问题
⚡刷题计划day27动态规划（一）开始，第三期后是背包专题，可以点个免费的赞哦~往期可看专栏，关注不迷路，您的支持是我的最大动力~目录什么是动态规划动态规划的解题步骤题目一：509.斐波那契数题目二：70.爬楼梯题目三：746.使用最小花费爬楼梯什么是动态规划动态规划，英文：DynamicProgramming，简称DP，如果某一问题有很多重叠子问题，使用动态规划是最有效的。特征:一个问题，可以拆
为什么WP建站更适合于谷歌SEO优化？推广小赵经验分享
在当今数字时代，建立一个网站似乎变得容易，但要构建一个真正能够带来流量和订单的网站却并非易事。特别是在谷歌SEO优化方面，不同的建站程序在SEO支持方面的效果差异显著。对于希望提升搜索引擎表现的用户来说，WordPress无疑是最佳选择。WordPress的优势作为一款强大且广泛使用的内容管理系统（CMS），WordPress最大的优势在于其灵活性和可扩展性。该平台允许用户利用丰富的SEO插件来优
力扣hot100 —— 11.盛最多的水 01_ leetcode 算法盛最多的水
题目描述：给定一个长度为n的整数数组height。有n条垂线，第i条线的两个端点是(i,0)和(i,height[i])。找出其中的两条线，使得它们与x轴共同构成的容器可以容纳最多的水。返回容器可以储存的最大水量。说明：你不能倾斜容器。解法思路：//木桶效应，短板决定水的上限，抽象问题一下，其实就是找出一对数字，俩者距离*较小数的值就是他们的水量//采用双指针，俩端开始，逐渐计算水量进行比较；//
15. 三数之和炫云云大数据算法和数据结构 leetcode 算法数据结构
15.三数之和1.两数之和15.三数之和18.四数之和20、n数之和给你一个包含n个整数的数组nums，判断nums中是否存在三个元素*a，b，c，*使得a+b+c=0？请你找出所有和为0且不重复的三元组。**注意：**答案中不可以包含重复的三元组示例1：输入：nums=[-1,0,1,2,-1,-4]输出：[[-1,-1,2],[-1,0,1]]示例2：
力扣 hot 100 —— 15.三数之和 01_ leetcode 算法三数之和
题目描述：给你一个整数数组nums，判断是否存在三元组[nums[i],nums[j],nums[k]]满足i!=j、i!=k且j!=k，同时还满足nums[i]+nums[j]+nums[k]==0。请你返回所有和为0且不重复的三元组。注意：答案中不可以包含重复的三元组。解法思路：//定位一个+双指针遍历查找//选定一个，然后在剩余中查找满足条件，为了好判断移动方向，可对数组进行排序//当三者和
力扣刷题Day2 RAN_PAND leetcode 算法数据结构 c++
389.找不同题目：给定两个字符串s和t，它们只包含小写字母。字符串t由字符串s随机重排，然后在随机位置添加一个字母。请找出在t中被添加的字母。示例1：输入：s="abcd",t="abcde"输出："e"解释：'e'是那个被添加的字母。示例2：输入：s="",t="y"输出："y"提示：0#includeusingnamespacestd;classSolution{public:charfin
【第四届网络安全、人工智能与数字经济国际学术会议（CSAIDE 2025】网络安全，人工智能，数字经济的研究禁默学术会议话题探讨 web安全人工智能安全数字经济学术论文
重要信息会议官网：www.csaide.net会议时间：2025年3月7-9日会议地点：马来西亚-马来西亚理工大学新山校区（线上+线下混合）简介过去几年，数字经济蓬勃发展，已成为全球经济增长的驱动力。然而，网络安全成为其最大的挑战。为了确保数字经济的可持续发展，人工智能被认为是至关重要的技术手段。第四届网络安全、人工智能与数字经济（CSAIDE2025）将于2025年3月7日至9日在马来西亚举行。
Autojs: 使用 SQLite xxxxxue 自动化工具 sqlite 数据库 autojs autox
例子letdb=newSQLiteUtil("/sdcard/A_My_DB/sqlite.db");db.fastCreateTable("user_table",{name:"",online:false,},["name"]//设置name为唯一,重复项不会添加成功);//新增数据的IDletrow_id=db.insert("user_table",{name:"小明5",online:t
教程 | Ventoy全攻略：2025最新安装与使用教程，打造万能多系统启动盘 The god of big data 教程神器？三叉戟？虚拟系统系统架构
一、Ventoy简介与核心优势Ventoy是一款开源免费的多系统启动盘工具，支持Windows、Linux、macOS等操作系统及各类维护工具。其最大特点是无需反复格式化U盘，只需将ISO/WIM/IMG等镜像文件直接拷贝至U盘即可启动，且支持LegacyBIOS与UEFI双模式。相较于传统工具，Ventoy的优势包括：多系统兼容性：支持超1000种ISO镜像，涵盖主流操作系统及工具（如Windo
C语言基础18：函数的概述、分类、定义以及形参和实参 k要开心 c语言开发语言
函数函数的概述函数：实现一定功能的，独立的代码模块。我们的函数一定是先定义，后使用。使用函数的优势：①我们可以通过函数提供功能给别人使用。当然我们也可以使用别人提供的函数，减少代码量。②借助函数可以减少重复性的代码。③实现结构化（模块化）程序设计思想。关于结构化设计思想：将大型的任务功能划分为相互独立的小型的任务模块来设计。函数是C语言程序的基本组成单元：C语言程序是由一个（必然是main函数）或
ranges::set_intersection set_union set_difference set_symmetric_difference 大树青云 C++20 C++set_union
std::ranges::set_intersection：是C++20引入的一个算法，用于计算两个已排序范围的交集。它将两个范围的交集元素复制到输出范围中。std::ranges::set_intersection用于计算两个已排序范围的交集。它将两个范围的交集元素复制到输出范围中。注意事项输入范围必须已排序。目标范围必须有足够空间存储交集结果。交集结果默认按升序排列。若元素重复，交集次数取两范
深度优先探索 ^O^凡人多烦事深度优先算法
DFS:时间复杂度：一位数组：O(n)二维数组+标记：O(n^2),有时候还可能使O(2^n),总而言之DFS的时间复杂度比较高。（个人认为）深度优先搜索算法（DFS）原理:深度优先搜索(DepthFirstSearch,DFS)是一种用于遍历或搜索树或图的算法。该方法从根节点（选择任意一个顶点作为起始节点，在无向图中适用）开始，尽可能深地沿着每条分支进行探索直到不能再前进为止；之后回退并重复这一
鸿蒙应用中使用本地存储实现数据共享 Y学院 Harmonyos harmonyos 华为
在鸿蒙应用开发中，使用本地存储来保存和共享数据是一个常见的需求。通过本地存储，我们可以在不同的页面之间共享数据，避免重复加载数据，提高应用的性能和用户体验。本文将详细介绍如何在鸿蒙应用中使用AppStorage实现数据的保存和加载，并在不同页面之间共享数据。1.引言在鸿蒙应用开发中，数据的持久化和共享是非常重要的。通过使用AppStorage，我们可以轻松地在应用的不同页面之间共享数据。本文将通过
关于滑动窗口算法--最小替换字串长度幼儿园口算大王算法 java 数据结构滑动窗口
个人觉得日常遇到的关于滑动窗口的算法题主要分两种：固定窗口大小的滑动窗口在固定窗口大小的滑动窗口问题中，窗口的大小是预先定义好的，不会改变。这种类型的问题是相对简单的，因为一旦确定了窗口的大小，就可以直接遍历数组或列表，每次移动窗口一个元素的位置。常见的问题包括：最大/最小子数组和：给定一个数组和一个固定大小的窗口，找到所有可能的窗口的最大/最小和。窗口内元素的统计：例如，统计窗口内奇数或偶数元素
shell编程之sed 小吃饱了 linux 运维服务器
1、sed工作原理sed是一种流编辑器，它是文本处理中非常有用的工具，能够完美的配合正则表达式使用，处理时，把当前处理的行存储在临时缓冲区中，称为模式空间，接着用sed命令处理缓冲区中的内容，处理完成后，把缓冲区的内容送往屏幕。接着处理下一行，这样不断重复，直到文件末尾。文件内容并没有改变。2、sed基本语法sedOPTIONS…[SCRIPT][INPUTFILE…]常用的选项：-n，--qui
《DeepSeek模型压缩：在高效与性能间寻平衡》人工智能深度学习
在人工智能飞速发展的当下，大语言模型不断迭代升级，规模与性能同步攀升。DeepSeek作为其中的佼佼者，在模型压缩技术上不断探索，力求在减小模型体积的同时，最大程度保留模型性能，为更广泛的应用场景提供支持。量化：用低精度表达，换存储空间与计算效率量化技术是DeepSeek模型压缩的关键手段之一，它将模型中的高精度浮点数参数转换为低比特数的整数或定点数，从而实现存储空间的大幅缩减与计算速度的提升。从
【学习】验证数独的正确性小飞哥咯咯咯学习学习
源于面试的一个问题，在leetcode里也有这道题，参考站内的一篇文章。首先此问题的分析需要满足三个约束条件：每行不能有重复的数每列不能有重复的数每个3*3的方格中不能有重复的数其中前两个约束条件都是容易满足的，关键在第三个。使用三个与数独相同尺寸的二维数组，作为visited的tag，分别记录行、列和3*3方格的数据。关键在于上述的16行代码，接下来将详细分析：首先i/3和j/3会将当前的位置映
继之前的线程循环加到窗口中运行 3213213333332132 java thread JFrame JPanel
之前写了有关java线程的循环执行和结束，因为想制作成exe文件，想把执行的效果加到窗口上，所以就结合了JFrame和JPanel写了这个程序，这里直接贴出代码，在窗口上运行的效果下面有附图。 package thread; import java.awt.Graphics; import java.text.SimpleDateFormat; import java.util
linux 常用命令 BlueSkator linux 命令
1.grep 相信这个命令可以说是大家最常用的命令之一了。尤其是查询生产环境的日志，这个命令绝对是必不可少的。但之前总是习惯于使用（grep -n 关键字文件名）查出关键字以及该关键字所在的行数，然后再用（sed -n '100,200p' 文件名），去查出该关键字之后的日志内容。但其实还有更简便的办法，就是用（grep -B n、-A n、-C n 关键
php heredoc原文档和nowdoc语法 dcj3sjt126com PHP heredoc nowdoc
<!doctype html> <html lang="en"> <head> <meta charset="utf-8"> <title>Current To-Do List</title> </head> <body> <?
overflow的属性周华华 JavaScript
<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.0 Transitional//EN" "http://www.w3.org/TR/xhtml1/DTD/xhtml1-transitional.dtd"> <html xmlns="http://www.w3.org/1999/xhtml&q
《我所了解的Java》——总体目录 g21121 java
准备用一年左右时间写一个系列的文章《我所了解的Java》，目录及内容会不断完善及调整。在编写相关内容时难免出现笔误、代码无法执行、名词理解错误等，请大家及时指出，我会第一时间更正。 &n
[简单]docx4j常用方法小结 53873039oycg docx
本代码基于docx4j-3.2.0，在office word 2007上测试通过。代码如下: import java.io.File; import java.io.FileInputStream; import ja
Spring配置学习云端月影 spring配置
首先来看一个标准的Spring配置文件 applicationContext.xml <?xml version="1.0" encoding="UTF-8"?> <beans xmlns="http://www.springframework.org/schema/beans" xmlns:xsi=&q
Java新手入门的30个基本概念三 aijuans java 新手 java 入门
17.Java中的每一个类都是从Object类扩展而来的。　　18.object类中的equal和toString方法。　　equal用于测试一个对象是否同另一个对象相等。　　toString返回一个代表该对象的字符串,几乎每一个类都会重载该方法,以便返回当前状态的正确表示.(toString 方法是一个很重要的方法)　　 19.通用编程:任何类类型的所有值都可以同object类性的变量来代替。　
《2008 IBM Rational 软件开发高峰论坛会议》小记 antonyup_2006 软件测试敏捷开发项目管理 IBM 活动
我一直想写些总结,用于交流和备忘,然都没提笔,今以一篇参加活动的感受小记开个头,呵呵! 其实参加《2008 IBM Rational 软件开发高峰论坛会议》是9月4号,那天刚好调休.但接着项目颇为忙,所以今天在中秋佳节的假期里整理了下. 参加这次活动是一个朋友给的一个邀请书,才知道有这样的一个活动,虽然现在项目暂时没用到IBM的解决方案,但觉的参与这样一个活动可以拓宽下视野和相关知识.
PL/SQL的过程编程,异常,声明变量,PL/SQL块百合不是茶 PL/SQL的过程编程异常 PL/SQL块声明变量
PL/SQL; 过程; 符号; 变量; PL/SQL块; 输出; 异常; PL/SQL 是过程语言(Procedural Language)与结构化查询语言(SQL)结合而成的编程语言PL/SQL 是对 SQL 的扩展,sql的执行时每次都要写操作
Mockito(三)--完整功能介绍 bijian1013 持续集成 mockito 单元测试
mockito官网：http://code.google.com/p/mockito/，打开documentation可以看到官方最新的文档资料。一.使用mockito验证行为 //首先要import Mockito import static org.mockito.Mockito.*; //mo
精通Oracle10编程SQL(8)使用复合数据类型 bijian1013 oracle 数据库 plsql
/* *使用复合数据类型 */ --PL/SQL记录 --定义PL/SQL记录 --自定义PL/SQL记录 DECLARE TYPE emp_record_type IS RECORD( name emp.ename%TYPE, salary emp.sal%TYPE, dno emp.deptno%TYPE ); emp_
【Linux常用命令一】grep命令 bit1129 Linux常用命令
grep命令格式 grep [option] pattern [file-list] grep命令用于在指定的文件(一个或者多个,file-list)中查找包含模式串(pattern)的行,[option]用于控制grep命令的查找方式。 pattern可以是普通字符串，也可以是正则表达式，当查找的字符串包含正则表达式字符或者特
mybatis3入门学习笔记白糖_ sql ibatis qq jdbc 配置管理
MyBatis 的前身就是iBatis，是一个数据持久层(ORM)框架。 MyBatis 是支持普通 SQL 查询，存储过程和高级映射的优秀持久层框架。MyBatis对JDBC进行了一次很浅的封装。以前也学过iBatis，因为MyBatis是iBatis的升级版本，最初以为改动应该不大，实际结果是MyBatis对配置文件进行了一些大的改动，使整个框架更加方便人性化。
Linux 命令神器：lsof 入门 ronin47 lsof
lsof是系统管理/安全的尤伯工具。我大多数时候用它来从系统获得与网络连接相关的信息，但那只是这个强大而又鲜为人知的应用的第一步。将这个工具称之为lsof真实名副其实，因为它是指“列出打开文件（lists openfiles）”。而有一点要切记，在Unix中一切（包括网络套接口）都是文件。有趣的是，lsof也是有着最多
java实现两个大数相加，可能存在溢出。 bylijinnan java实现
import java.math.BigInteger; import java.util.regex.Matcher; import java.util.regex.Pattern; public class BigIntegerAddition { /** * 题目：java实现两个大数相加，可能存在溢出。 * 如123456789 + 987654321
Kettle学习资料分享，附大神用Kettle的一套流程完成对整个数据库迁移方法 Kai_Ge Kettle
Kettle学习资料分享 Kettle 3.2 使用说明书目录概述..........................................................................................................................................7 1.Kettle 资源库管
[货币与金融]钢之炼金术士 comsci 金融
自古以来,都有一些人在从事炼金术的工作.........但是很少有成功的那么随着人类在理论物理和工程物理上面取得的一些突破性进展...... 炼金术这个古老
Toast原来也可以多样化 dai_lm android toast
Style 1：默认 Toast def = Toast.makeText(this, "default", Toast.LENGTH_SHORT); def.show(); Style 2：顶部显示 Toast top = Toast.makeText(this, "top", Toast.LENGTH_SHORT); t
java数据计算的几种解决方法3 datamachine java hadoop ibatis r-langue r
4、iBatis 简单敏捷因此强大的数据计算层。和Hibernate不同，它鼓励写SQL，所以学习成本最低。同时它用最小的代价实现了计算脚本和JAVA代码的解耦，只用20%的代价就实现了hibernate 80%的功能,没实现的20%是计算脚本和数据库的解耦。复杂计算环境是它的弱项，比如：分布式计算、复杂计算、非数据
向网页中插入透明Flash的方法和技巧 dcj3sjt126com html Web Flash
将 Flash 作品插入网页的时候，我们有时候会需要将它设为透明，有时候我们需要在Flash的背面插入一些漂亮的图片，搭配出漂亮的效果……下面我们介绍一些将Flash插入网页中的一些透明的设置技巧。　　一、Swf透明、无坐标控制　　首先教大家最简单的插入Flash的代码，透明，无坐标控制：　　注意wmode="transparent"是控制Flash是否透明
ios UICollectionView的使用 dcj3sjt126com
UICollectionView的使用有两种方法，一种是继承UICollectionViewController，这个Controller会自带一个UICollectionView；另外一种是作为一个视图放在普通的UIViewController里面。个人更喜欢第二种。下面采用第二种方式简单介绍一下UICollectionView的使用。 1.UIViewController实现委托，代码如
Eos平台java公共逻辑蕃薯耀 Eos平台java公共逻辑 Eos平台 java公共逻辑
Eos平台java公共逻辑 >>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>>> 蕃薯耀 2015年6月1日 17:20:4
SpringMVC4零配置--Web上下文配置【MvcConfig】 hanqunfeng springmvc4
与SpringSecurity的配置类似，spring同样为我们提供了一个实现类WebMvcConfigurationSupport和一个注解@EnableWebMvc以帮助我们减少bean的声明。 applicationContext-MvcConfig.xml  <
解决ie和其他浏览器poi下载excel文件名乱码 jackyrong Excel
使用poi,做传统的excel导出，然后想在浏览器中，让用户选择另存为，保存用户下载的xls文件，这个时候，可能的是在ie下出现乱码（ie,9,10,11),但在firefox,chrome下没乱码，因此必须综合判断，编写一个工具类： /** * * @Title: pro
挥洒泪水的青春 lampcy 编程生活程序员
2015年2月28日，我辞职了，离开了相处一年的触控，转过身--挥洒掉泪水，毅然来到了兄弟连，背负着许多的不解、质疑——”你一个零基础、脑子又不聪明的人，还敢跨行业，选择Unity3D？“，”真是不自量力••••••“，”真是初生牛犊不怕虎•••••“，••••••我只是淡淡一笑，拎着行李----坐上了通向挥洒泪水的青春之地——兄弟连！这就是我青春的分割线，不后悔，只会去用泪水浇灌——已经来到
稳增长之中国股市两点意见-----严控做空，建立涨跌停版停牌重组机制 nannan408
对于股市，我们国家的监管还是有点拼的，但始终拼不过飞流直下的恐慌，为什么呢？笔者首先支持股市的监管。对于股市越管越荡的现象，笔者认为首先是做空力量超过了股市自身的升力，并且对于跌停停牌重组的快速反应还没建立好，上市公司对于股价下跌没有很好的利好支撑。我们来看美国和香港是怎么应对股灾的。美国是靠禁止重要股票做空，在
动态设置iframe高度(iframe高度自适应) Rainbow702 JavaScript iframe contentDocument 高度自适应局部刷新
如果需要对画面中的部分区域作局部刷新，大家可能都会想到使用ajax。但有些情况下，须使用在页面中嵌入一个iframe来作局部刷新。对于使用iframe的情况，发现有一个问题，就是iframe中的页面的高度可能会很高，但是外面页面并不会被iframe内部页面给撑开，如下面的结构： <div id="content"> <div id=&quo
用Rapael做图表 tntxia rap
function drawReport(paper,attr,data){ var width = attr.width; var height = attr.height; var max = 0; &nbs
HTML5 bootstrap2网页兼容（支持IE10以下） xiaoluode html5 bootstrap
<!DOCTYPE html> <html> <head lang="zh-CN"> <meta charset="UTF-8"> <meta http-equiv="X-UA-Compatible" content="IE=edge">