count of reads mapped to 500 coding sequences, in scaffold4:1-2M span summarized here for short span of interest. T = reads mapping to gene coding sequence; S = reads w/ SNP mapping to gene cds, pS = S/T tcacao_L002 tcacao_L003 tcacao_L007 pSnp S T pS S T pS S T Thecc1EG016781t1 0.012 4 322 0.018 5 284 0.030 10 337 Thecc1EG016784t1 0.214 25 117 0.187 23 123 0.268 41 153 Thecc1EG016785t1 0.089 46 515 0.111 48 432 0.085 44 517 Thecc1EG016786t1 0.314 16 51 0.360 9 25 0.433 13 30 | Thecc1EG016787t1 0.336 130 387 0.439 119 271 0.447 143 320 | Thecc1EG016788t1 0.378 108 286 0.528 130 246 0.503 148 294 Thecc1EG016789t1 0.333 1 3 0.750 3 4 0.333 1 3 Thecc1EG016791t1 0.049 8 164 0.083 13 156 0.062 11 176 Thecc1EG016792t1 0.000 0 239 0.000 0 178 0.000 0 219 Thecc1EG016794t1 0.000 0 4 0.000 0 6 0.000 0 9 Thecc1EG016799t1 0.400 6 15 0.667 4 6 0.583 7 12 Thecc1EG016802t1 0.167 1 6 0.000 0 4 0.100 1 10 > Thecc1EG016803t1 0.724 21 29 0.600 24 40 0.680 34 50 Thecc1EG016804t1 0.500 1 2 1.000 2 2 0.800 4 5 > Thecc1EG016805t1 0.755 216 286 0.713 206 289 0.779 218 280 Thecc1EG016806t1 0.189 86 454 0.194 84 433 0.213 105 493 Thecc1EG016808t1 0.037 6 160 0.077 9 117 0.067 12 180 Thecc1EG016809t1 0.000 0 3 0.000 0 1 0.000 0 4 Thecc1EG016810t1 0.029 15 525 0.026 13 500 0.026 14 531 Thecc1EG016811t1 0.348 228 655 0.418 243 582 0.376 248 659 > Thecc1EG016812t1 0.436 260 596 0.484 257 531 0.462 294 637 Thecc1EG016813t1 0.154 22 143 0.195 22 113 0.169 21 124 Thecc1EG016814t1 0.106 233 2198 0.095 171 1800 0.098 201 2050 Thecc1EG016815t1 0.000 0 372 0.000 0 310 0.000 0 377 Thecc1EG016816t1 0.000 0 562 0.000 0 463 0.000 0 590 Thecc1EG016818t1 0.035 180 5071 0.049 203 4180 0.033 163 4908 Thecc1EG016819t1 0.335 109 325 0.300 89 297 0.346 116 335 Files at http://server7.eugenes.org:8091/cacao/genes10/rnas/snprna/ snpout5/ ==> pub3h_sc4m2.tcacao_L007.psnp.txt <== ==> pub3h_sc4m2.tcacao_L003.psnp.txt <== ==> pub3h_sc4m2.tcacao_L002.psnp.txt <== count of reads mapped to gene coding sequences, all and those with snp, ratio (pS=S/All), plus count of genomic snp (gsnp) per coding sequence. in scaffold4:1-2M span only gene_id_________ pS snp all gsnp Thecc1EG016762t1 0.000 0 3 363 Thecc1EG016763t1 0.000 0 6 230 Thecc1EG016764t1 0.000 0 0 10 Thecc1EG016765t1 0.000 0 0 5 Thecc1EG016767t1 0.500 11 22 339 Thecc1EG016768t1 0.000 0 0 96 Thecc1EG016770t1 0.000 0 0 102 Thecc1EG016772t1 0.300 3 10 175 Thecc1EG016775t1 0.149 1017 6819 18 ==> snp5cds3h_tcacao_L003.snp2u <== ==> snp5cds3h_tcacao_L003.snp2u <== ==> snp5cds3h_tcacao_L002.snp2u <== - count of reads with snp perfectly mapped to coding sequences, snp offset from start_codon, and codon position (1,2,3) for entire genome. nRead GeneID________ codon CDSpos 1 Thecc1EG000002t1 2 5 1 Thecc1EG000002t1 3 135 1 Thecc1EG000003t1 3 837 3 Thecc1EG000005t1 3 786 2 Thecc1EG000005t1 3 1095 15 Thecc1EG000005t1 1 1966 1 Thecc1EG000005t1 3 2169 38 Thecc1EG000005t1 2 3182 196 Thecc1EG000005t1 2 3698 Count of codon positions with snp (entire genome): snp5cds3h_tcacao_L002.snp2u 14119 1 12587 2 27399 3 snp5cds3h_tcacao_L003.snp2u 13424 1 11864 2 26337 3 snp5cds3h_tcacao_L007.snp2u 14157 1 12657 2 27521 3 ========= Sample GSNAP mapping of reads to coding sequences including snp location SNP taken from Unified 10 SNP data set (October 2011). Map output shows read with lower case base mis-alignments, both snp and non-snp, gene id and span in CDS, number of mis-aligns (sub=0+1=1; sub=3+0=3 as mis-align count + snp count = total), and snps:n@s4b12345 ID-position of snp, as well as align score and matepair score/insert_length snp5cds3h/tcacao_L002.1.gsnap1.out CTGAGATGTCAACTTTCTTCCACTCGTAGAGTTCCATGTCATAGCACTCATCGAGGaCAAATTGGGGGATCTCTTGTCCACGGAAAAGCCATAATCCCTTCACTTTGAATGG 1..112 -Thecc1EG006138t1:1177..1066 start:0..end:0,matches:112,sub:0+1=1,snps:57@s2b908170 segs:1,align_score:0,mapq:34 pair_score:1,insert_length:213 CATTGATCTTCTCAGCAACCTGGCAAATCACGTCCCTTGGATCACCACTCTCTACTCTCACCTCCACCTTgACCTCATCGGCTTGCTCCCTGCACAtCCtCTTAGCCTTCTC 1..112 -Thecc1EG026752t1:361..250 start:0..end:0,matches:110,sub:2+1=3,snps:71@s5b39893579 segs:1,align_score:2,mapq:40 pair_score:2,insert_length:258 TCAACATGTTCTTCACTTTCATCATTGCTCAACTTTTTCTCTCCATGCTTTGcCACATGAAATTCGGCCTTTTCTTCTTCTTCGCTGCATTCGTTGTgACAATGACTATTTT 1..112 +Thecc1EG007706t1:1217..1328 start:0..end:0,matches:111,sub:1+1=2,snps:15@s2b8458161 segs:1,align_score:1,mapq:38 pair_score:1,insert_length:294 CAAGTTCAAGCGTAAGAGGGTCCCGAAGGCTTCAGGGTCTCCACCTGTGCCGGTaATGCATTCCCCTCCACGGCCTGTGACTGTGAAGGATCAtCAGGACTGGAAAATTCCg 1..112 +Thecc1EG020026t1:651..762 start:0..end:0,matches:112,sub:0+3=3,snps:106@s4b26233589|101@s4b26233584|85@s4b26233568|58@s4b26233541|19@s4b26233502|1@s4b26233484 segs:1,align_score:0,mapq:40 pair_score:0,insert_length:289 ============ You presumably looked at bottom of this doc cacao/genes10/rnas/snprna/cacao3g-cgb2rd-snp10.info.txt which shows the raw output example. This info contains the snp position in CDS, and alternate base (other part above this shows reference bases), so 'a' in middle of this read is the snp change. The genomic location of snp is 'snps:57@s2b908170', that is s2=scaffold_2, base b908170 snp5cds3h/tcacao_L002.1.gsnap1.out CTGAGATGTCAACTTTCTTCCACTCGTAGAGTTCCATGTCATAGCACTCATCGAGGaCAAATTGGGGGATCTCTTGTCCACGGAAAAGCCATAATCCCTTCACTTTGAATGG 1..112 -Thecc1EG006138t1:1177..1066 start:0..end:0,matches:112,sub:0+1=1,snps:57@s2b908170 segs:1,align_score:0,mapq:34 pair_score:1,insert_length:213 This snp 'a' is at 1177 - 57 + 1 = 1121 which appears to be codon#2 (this read is reverse pair of gene strand) -- oops, I mixed up read and reference lines from gsnap, the line above is reference coding seq of Thecc1EG006138t1 with 'a' at snp position, the read has 'G' at snp position 'a'. Mapping to genome gives same style output if you want snp locations, and alignment with lower case bases also has to be parsed for snp positions. For use with gsnap, when I converted the Unified 10 SNP data set, each variant at position has an entry, but gsnap handles 2+ variants by calling it a wild-card (N) position (so any base at position will be accepted as valid snp-align). ==== unfdSNPs_10_sets, snp ID=s2b908170, reference base r=T, snp change dacgt=C scaffold_2 unfd SNP 908170 908171 10 . . ID=2b908170;r=T;ig=5;dacgt=0,0,1,0,10 mapped read pair: >NTGAGATGTCAACTTTCTTCCACTCGTAGAGTTCCATGTCATAGCACTCATCGAGGGCAAATTGGGGGATCTCTTGTCCACGGAAAAGCCATAATCCCTTCACTTTGAATGG 1 concordant IRIS:3:vElertTruseqCacaoCriolloPound7:2:1:13483:1025 CTGAGATGTCAACTTTCTTCCACTCGTAGAGTTCCATGTCATAGCACTCATCGAGGaCAAATTGGGGGATCTCTTGTCCACGGAAAAGCCATAATCCCTTCACTTTGAATGG 1..112 -Thecc1EG006138t1:1177..1066 start:0..end:0,matches:112,sub:0+1=1,snps:57@s2b908170 segs:1,align_sc ore:0,mapq:34 pair_score:1,insert_length:213 'A' amino reference codon: GaC = rev(GtC) => 'V' amino cds: ...GtCCTCGATGAGTGCTATGACATGGAACTCTACGAGTGGAAGAAAGTTGACATCTCAGACGAAGCCCAAAAGGAACGTGTCAGTCAGATGATTGAAGACTGCGAGC CATTCGAGGGAGAGCCTCTTTTGGATGCCAAGTGCTTCAAGTGA (stop codon) amino: ...VLDECYDMELYEWKKVDISDEAQKERVSQMIEDCEPFEGEPLLDAKCFK* ^A snp protein change >Thecc1EG006138t1 loc=scaffold_2:905267-908318:+;type=CDS.evd3ec;nx=7;len=1269 ATGGCTCTGGTCTTGCACGCGGGAAAGAACAACAAAAATGCCGTCAAGGCACTCATTGCT GCACAATACTGTGATGTCGAGGTCAAATTAGCTGAAAACTTTGAGATGGGTGTCACAAAT AAATCTCCTGAGTTCCTCAAGATGAACCCTATCGGGAAGGTTCCCGTTTTGGAAACACCT GAGGGTCCTGTATTTGAGAGCAATGCCATTGCTCGTTATGTTACTCGCATAAAGGCTGAC AACCCTCTATTTGGTTCTACATTGATCGATTATGGTCATATTGAGCAGTGGACTGATTTT GCAGCCATGGAAATTGATGTTAATATTTCAAAATGGCTCTATCCAAGACTTGGATATGGT GTACACCTTCCTCTGGCTGAGGAACATGCTATTGCTTCATTGAAGAGAGCACTAGACGCA TTAAACACTCACCTTGCTTCCAACACCTATCTGGTTGGACATTCAGTCAGCCTTGCTGAC ATTGTCATGACATGCAACCTCTATTTGGGTTTCTCCCAGATCATGACTAAGAGCTTTACC TCTGAATTCCCTCATGTTGAGAGGTACTTCTGGACCATGGTTAATCAACCAAATTTCAAG AAGATTCTTGGTGAAGTGAAGCAAGCAGAGTCTGTGCCACCTGTTGCCTCAAAGAAGCCT GCTGCCCAGCCAAAAGAAACTAAACCAAAGGCCAAGAATGAACCAAAGAAAGAACCCAAA AAGGAGGTTGAGAAACCAGCTAAGGCAGAGGCTGCTGAGGAGGAAGAGGCACCAAAGCCC AAACCAAAGAATCCTCTTGATTTGCTGCCTCCAAGTAAGATGATACTGGATGAGTGGAAG AGGCTGTACTCTAATACAAAGACCAACTTCCGTGAGGTTGCAATTAAAGGATTCTGGGAC ATGTATGATCCTGAGGGATACTCACTCTGGTTCTGCGACTACAAGTACAATGAAGAGAAT ACAGTCTCATTTGTCACCATGAACAAGGTAGGGGGATTCCTGCAGCGAATGGATTTGGCA CGCAAGTATGCATTTGGGAAGATGCTCGTGATCGGCTCTGAGCCCCCATTCAAAGTGAAG GGATTATGGCTTTTCCGTGGACAAGAGATCCCCCAATTTGtCCTCGATGAGTGCTATGAC << snp position, at -150 bp from stop codon ATGGAACTCTACGAGTGGAAGAAAGTTGACATCTCAGACGAAGCCCAAAAGGAACGTGTC AGTCAGATGATTGAAGACTGCGAGCCATTCGAGGGAGAGCCTCTTTTGGATGCCAAGTGC TTCAAGTGA >Thecc1EG006138t1 aalen=422; Name=Elongation factor 1-gamma 3 (78%U); Dbxref=TAIR:AT1G09640.1,UniRef50_Q5Z627; quality= MALVLHAGKNNKNAVKALIAAQYCDVEVKLAENFEMGVTNKSPEFLKMNPIGKVPVLETP EGPVFESNAIARYVTRIKADNPLFGSTLIDYGHIEQWTDFAAMEIDVNISKWLYPRLGYG VHLPLAEEHAIASLKRALDALNTHLASNTYLVGHSVSLADIVMTCNLYLGFSQIMTKSFT SEFPHVERYFWTMVNQPNFKKILGEVKQAESVPPVASKKPAAQPKETKPKAKNEPKKEPK KEVEKPAKAEAAEEEEAPKPKPKNPLDLLPPSKMILDEWKRLYSNTKTNFREVAIKGFWD MYDPEGYSLWFCDYKYNEENTVSFVTMNKVGGFLQRMDLARKYAFGKMLVIGSEPPFKVK GLWLFRGQEIPQFVLDECYDMELYEWKKVDISDEAQKERVSQMIEDCEPFEGEPLLDAKC ^- A snp change, -50 aa from stop codon FK*