Third-party cyber evaluations involving OpenAI models
(news.ycombinator.com)
1.
2.
Murati's Thinking Machines Releases Open-Weights 975B Parameter LLM
(news.ycombinator.com)
3.
Separating signal from noise in coding evaluations
(news.ycombinator.com)
4.
Arena, the AI leaderboard everyone uses, is now a $100M business
(techcrunch.com)
5.
Evaluating large language models for accuracy incentivizes hallucinations
(feeds.nature.com)
6.
Gemini 3.1 Pro
(news.ycombinator.com)
7.
How to Evaluate LLMs and GenAI Workflows Holistically
(computer.org)
Today's top topics:
dark