[yahoo] Add an extractor for yahoo news (closes #1849)

[youtube-dl.git] / youtube_dl / extractor / arte.py
diff --git a/youtube_dl/extractor/arte.py b/youtube_dl/extractor/arte.py

index a636c6be56395e71764d0522526988bf0288b3cb..8b62ee774cc021d4b77e97aced8034f72d4d64e4 100644 (file)
--- a/youtube_dl/extractor/arte.py
+++ b/youtube_dl/extractor/arte.py
@@ -1,7 +1,6 @@
  # encoding: utf-8
  import re
  import json
-import xml.etree.ElementTree
  
  from .common import InfoExtractor
  from ..utils import (
@@ -69,7 +68,7 @@ class ArteTvIE(InfoExtractor):
              lang = mobj.group('lang')
              return self._extract_liveweb(url, name, lang)
  
-        if re.search(self._LIVE_URL, video_id) is not None:
+        if re.search(self._LIVE_URL, url) is not None:
              raise ExtractorError(u'Arte live streams are not yet supported, sorry')
              # self.extractLiveStream(url)
              # return
@@ -78,8 +77,7 @@ class ArteTvIE(InfoExtractor):
          """Extract from videos.arte.tv"""
          ref_xml_url = url.replace('/videos/', '/do_delegate/videos/')
          ref_xml_url = ref_xml_url.replace('.html', ',view,asPlayerXml.xml')
-        ref_xml = self._download_webpage(ref_xml_url, video_id, note=u'Downloading metadata')
-        ref_xml_doc = xml.etree.ElementTree.fromstring(ref_xml)
+        ref_xml_doc = self._download_xml(ref_xml_url, video_id, note=u'Downloading metadata')
          config_node = find_xpath_attr(ref_xml_doc, './/video', 'lang', lang)
          config_xml_url = config_node.attrib['ref']
          config_xml = self._download_webpage(config_xml_url, video_id, note=u'Downloading configuration')
@@ -109,13 +107,12 @@ class ArteTvIE(InfoExtractor):
          """Extract form http://liveweb.arte.tv/"""
          webpage = self._download_webpage(url, name)
          video_id = self._search_regex(r'eventId=(\d+?)("|&)', webpage, u'event id')
-        config_xml = self._download_webpage('http://download.liveweb.arte.tv/o21/liveweb/events/event-%s.xml' % video_id,
+        config_doc = self._download_xml('http://download.liveweb.arte.tv/o21/liveweb/events/event-%s.xml' % video_id,
                                              video_id, u'Downloading information')
-        config_doc = xml.etree.ElementTree.fromstring(config_xml.encode('utf-8'))
          event_doc = config_doc.find('event')
          url_node = event_doc.find('video').find('urlHd')
          if url_node is None:
-            url_node = video_doc.find('urlSd')
+            url_node = event_doc.find('urlSd')
  
          return {'id': video_id,
                  'title': event_doc.find('name%s' % lang.capitalize()).text,
@@ -182,15 +179,22 @@ class ArteTVPlus7IE(InfoExtractor):
                  formats = all_formats
              else:
                  raise ExtractorError(u'The formats list is empty')
-        # We order the formats by quality
+
          if re.match(r'[A-Z]Q', formats[0]['quality']) is not None:
-            sort_key = lambda f: ['HQ', 'MQ', 'EQ', 'SQ'].index(f['quality'])
+            def sort_key(f):
+                return ['HQ', 'MQ', 'EQ', 'SQ'].index(f['quality'])
          else:
-            sort_key = lambda f: int(f.get('height',-1))
+            def sort_key(f):
+                return (
+                    # Sort first by quality
+                    int(f.get('height',-1)),
+                    int(f.get('bitrate',-1)),
+                    # The original version with subtitles has lower relevance
+                    re.match(r'VO-ST(F|A)', f.get('versionCode', '')) is None,
+                    # The version with sourds/mal subtitles has also lower relevance
+                    re.match(r'VO?(F|A)-STM\1', f.get('versionCode', '')) is None,
+                )
          formats = sorted(formats, key=sort_key)
-        # Prefer videos without subtitles in the same language
-        formats = sorted(formats, key=lambda f: re.match(r'VO(F|A)-STM\1', f.get('versionCode', '')) is None)
-        # Pick the best quality
          def _format(format_info):
              quality = ''
              height = format_info.get('height')