
Scraping for Journalism: A Guide for Collecting Data Photo by Dan Nguyen/ProPublica Our Dollars for Docs news application lets readers search pharmaceutical company payments to doctors. We’ve written a series of how-to guides explaining how we collected the data. Most of the techniques are within the ability of the moderately experienced programmer. The most difficult-to-scrape site was actually a previous Adobe Flash incarnation of Eli Lilly’s disclosure site. Lilly has since released their data in PDF format. These recipes may be most helpful to journalists who are trying to learn programming and already know the basics. If you are a complete novice and have no short-term plan to learn how to code, it may still be worth your time to find out about what it takes to gather data by scraping web sites -- so you know what you’re asking for if you end up hiring someone to do the technical work for you. The tools With the exception of Adobe Acrobat Pro, all of the tools we discuss in these guides are free and open-source. A Guide to the Guides
Du rôle prédictif des données à la gouvernementalité algorithmique Sur Place de la Toile, le 12 décembre dernier, Xavier de la Porte recevait Guillaume Main, consultant et statisticien, qui s’occupe du site Statosphère ; Erick Alphonse, maître de conférences au Laboratoire d’Informatique de Paris-Nord (LIPN) et responsable d’Idaaas, une société qui construit des modèles prédictifs, notamment via PredictiveDB, un logiciel prédictif et Antoinette Rouvroy, chercheuse au Fonds national de la Recherche scientifique, qui travaille sur les formes de pouvoir induites par l’usage des données. Réécouter l’émission en ligne, ou parcourez le transcript augmenté de liens. Il y a de multiples formes de données, rappelle en préambule Xavier de la Porte : données sociales, messages, commentaires, celles qu’on publie chez les autres ou que les autres publient sur soi. Il y a bien sûr les données comportementales : celles qui mesurent ce que vous faites sur l’internet, les données géographiques, les données publiques, les données privées. Erick Alphonse : Oui.
Non, les données ne sont pas du pétrole... Il ne se passe plus une semaine sans un dossier spécial titrant sur "les data, pétrole du XXIe Siècle", "data is the new oil", "les données, le nouvel or noir", "vos données personnelles valent 315 milliards d'euros", "profitez des opportunités des big data", voire même un "trésor caché" et j'en passe. On comprend bien la métaphore : les données personnelles, les données publiques, les données de l'internet des objets seraient comme le pétrole : une ressource naturelle, fluide, susceptibles de toutes sortes de transformations, et porteuses d'un énorme potentiel de valeur. Plus encore, elles seraient le ferment d'une nouvelle révolution industrielle, appelées à plier l'économie mondiale à leur puissant potentiel industriel. On comprend la métaphore, mais elle n'en n'est pas moins lassante. Le pétrole est une ressource naturelle non renouvelable. Il y a donc beaucoup d'inconvénients à pousser trop loin la métaphore du pétrole. D'une part, les données sont "moins" qu'une matière brute.
Open Data: Paris place ses données publiques sous licence ODbL Les données publiques ouvertes (non, il ne s'agit pas de WikiLeaks :-)), on en parle dans le monde, des gouvernements ont créé des portails vers leurs données ouvertes comme aux Etats-Unis (data.gov) ou en Grande-Bretagne (data.gov.uk). Et en France? Ça avance au moins localement, puisque ce mardi le Conseil de Paris a voté une délibération (PDF) approuvant «la licence Open Data relative à la diffusion par la ville de Paris des données publiques en sa possession». L'Hôtel de ville de Paris, image de Benh Lieu Song (sur Wikipédia), sous licence Creative Commons by-sa Le principe en avait été validé lors du conseil de Paris des 7 et 8 juin 2010. il prépare les contrats de licence types adaptés à chaque catégorie de données et à leurs finalités en veillant à garantir, pour l’ensemble des données diffusées, les principes d’accès libre et non discriminatoire de réutilisation et de rediffusion des données pour tout usage non commercial.» Libre accès seulement ou libre usage? A suivre! Sur la Toile
Quand nos requêtes aident à tracer les évolutions de la grippe Par Hubert Guillaud le 20/11/08 | 3 commentaires | 4,281 lectures | Impression Google vient de dévoiler un outil expérimental, baptisé Google Flu Trends, capable de tracer l’intensité et l’étendu des fluctuations de la grippe à travers les Etats-Unis, simplement en observant les requêtes sur ce sujet des utilisateurs de son moteur de recherche. Google Flu Trends s’appuie sur un constat simple : avant d’aller chez le docteur, nombre d’internautes ont tendance à chercher des informations sur les symptômes qu’ils ressentent. D’autres systèmes existent encore comme HealthMap, qui permet de cartographier des informations de santé pour montrer comment se répandent des maladies. Mais il n’y a pas que la grippe dont on peut prédire l’impact en regardant le comportement des internautes.
Big Data : faire du sens à grande échelle » Article » OWNI, Digital Journalism Après l'open-data la nouvelle tendance tout droit venue des US sera-t-elle le « big data » ? D’un récent voyage dans la Silicon Valley (merci aux amis du Orange Institute), je rentre avec une conviction : tout ce que nous connaissions du web va changer à nouveau avec le phénomène des big data. Il pose à nouveau, sur des bases différentes, presque toutes les questions liées à la transformation numérique. En 2008, l’humanité a déversé 480 milliards de Gigabytes sur Internet. Ces données ne sont pas toutes des œuvres. Naviguer dans ce nouveau web demande une nouvelle science. Qu’est-ce qui change avec les big data ? L’actualité de la semaine nous a donné une petite illustration de ce qui se passe à grande échelle. On sent bien que l’on est tout près d’un phénomène d’émergence. Les outils sont-ils prêts ? Ce qui est fascinant avec la Silicon Valley, c’est qu’une telle perspective y devient immédiatement un carburant pour la recherche et la création. Il commence à avoir des résultats concrets.
Comment extraire en données structurées les infos contenues sur des pages web Si vous avez besoin d'extraire des données à partir de pages web pour les transformer en données structurées, j'ai peut-être un truc qui va vous plaire. Il s'agit d'un bookmarklet qui se place dans votre barre de favoris sur votre navigateur et qui permet d'exporter sous forme de tableau CSV, le contenu d'une page web. Par exemple, sur Amazon, je peux extraire en données structurées une page de résultat. Vous trouverez toutes les infos ici et une démo en vidéo ci-dessous : Rejoignez les 60820 korbenautes et réveillez le bidouilleur qui est en vous Suivez KorbenUn jour ça vous sauvera la vie.. The Good, the Sad and the Nerdy « Stop. Datatime. I do hope that most of you have paid attention to the first British election debate held last week on national television. The leaders of the three main parties were invited to discuss questions asked by a sample of British citizens and selected beforehand by broadcasters. A fortnight before the main event, a set of 76 detailed rules were announced, to prevent from any kind of uneven treatment. Many issues were addressed in this first electoral debate : Education, Immigration, Law and Order, NHS, Family, Defence… The full house, pretty much. Mark my words:who will best tackle the data issue? Gordon Brown, if not the coolest-looking lad in town, was actually the first one to embrace the data gathering process. The project follows the footsteps of Where Does My Money Go, an interactive visualization tool based on data retrieved from the HM Treasury in late 2009. Da-tax heaven : “Where Does My Money Go ?” Labour Manifesto : View here the Manifesto set by Gordon Brown for this General Election.
Web-mining.fr Les données ? C'est de la merde. Justement. Ok. J'explique rapidement le titre un tantinet vulgaire. A l'occasion de la conférence CHI 2014 (sur les interfaces / interactions homme-machine) un groupe d'étudiants a publié un site sur un prototype un peu particulier dédié au "quantified self" : des toilettes. Des "Quantified Toilets" très exactement. Et oui. #BigData versus #GrosCaca Alors bien sûr c'est une blague potache. A l'heure donc des #BigData et de la médecine 2.0, il n'est ni très étonnant ni très improbable que dans le spectre des données analysables, la nature / composition / fréquence / consistance de nos selles soit également prise en compte. Le tout de manière parfaitement "non-intrusive", gratuite, privée, etc. Le stade anal de l'âge social ? Par l'un de ces retournements dont la technique a le secret, nous voilà donc ramenés, via ces Quantified Toilets à la préhistoire de la médecine. Nous voilà enfin de retour à une sorte de stade anal du quantified self, point culminant d'un autre stade que l'on eût dit social.
How Journalists are Using Social Media for Real Results The Real Results series is supported by Gist, an online service that helps you build stronger relationships. By connecting your inbox to the web, you get business-critical information about key people and companies. See how it works here. Journalists are, by nature, crafty folk who are wonderfully adept at stalking — I mean, finding sources and relevant information for various and sundry stories. Still, as the Internet continues to expand, it can be difficult to pick and choose which tools are right for you as a journalist — it can be daunting to litter one's desktop with Twitter applications, social networks, location-based tools and blogs. Still, if one can manage to circumvent the information overload and pick and choose which tools are most effective for which purposes, social media can be an extremely effective. Mashable spoke with an array of journalists and industry folks to see how they're using social media in their day-to-day work. Finding Leads, Noticing Trends Finding Sources
Data Mining Vs. Semantic Web This tutorial covers the field of datamining in general, talks about its possible applications (special case studies can be added on request), and elaborates on the issue of hardware accelerators for datamining. The introduction gives a formal and an informal definition (through an example), plus it points to possible missunderstandings typical of the topic. The part on methods and algorithms covers a number of different approaches, each one presented thru animation, using the examples that are both colourfull and unusual, but excellent for pointing into the essence. The part on tools lists about a dozen different tools, and selects one for a detailed case study. The part on applications includes examples from a variety of different fields (engineering, science, medicine, psychiatry, etc...) Would you like to put a link to this lecture on your homepage?